Die heutigen KI-Trends
Amazon SageMaker bietet nun Prefix-aware Routing, das Anfragen mit gemeinsamem Präfix auf derselben Inference Instance hält, einschließlich Einstellungen für Präfixlänge und Concurrency-Schwellenwert. AWS berichtet in seinem konkreten Benchmark von bis zu 77 % niedrigerer P50-Zeit bis zum ersten Token. Praktisch heißt das: Teste die Stabilität von Prompt-Präfixen und Replica Affinity gemeinsam, nicht als getrennte Tuning-Aufgaben. AWS-Dokumentation AWS-Benchmarkbericht
SageMaker HyperPod dokumentiert jetzt Host-lokales NVMe-Caching für Modellgewichte und Inference-Server-Images, einschließlich Vorbefüllung, um beim Scale-out wiederholte Remote-Downloads zu vermeiden. Beim Autoscaling sollten Pod-Scheduling und Readiness deshalb getrennt von der Zeit bewertet werden, bis ein Modell tatsächlich Serving-Bereitschaft erreicht. AWS-Dokumentation
Die GenAI Semantic Conventions von OpenTelemetry definieren gemeinsame Attribute und Operationsnamen für Agent-, Conversation-, Workflow-, Tool-, Retrieval-, Provider- und Cache-Telemetrie. Praktisch heißt das, früh portable Feldnamen zu verwenden und Tool-Argumente sowie Ergebnisse als potenziell sensible Observability-Daten zu behandeln. OpenTelemetry-Spezifikation