Amazon SageMaker Inference hat im Berichtszeitraum Januar bis September 2026 insgesamt 13 neue Funktionen für die Inferenz generativer KI-Modelle eingeführt.
Die Neuerungen verteilen sich auf zwei Bereitstellungspfade: vollständig verwaltete SageMaker Endpoints und Kubernetes-native Amazon SageMaker HyperPod Inference.
Managed Endpoints
AWS hat sieben zentrale Verbesserungen für Managed Endpoints veröffentlicht:
- Inferenz-Empfehlungen und Benchmarking automatisieren die Auswahl von Instanztyp, Serving-Container und Optimierungseinstellungen auf Basis definierter Leistungsziele.
- Kapazitätsbewusste Instance Pools ermöglichen die Definition priorisierter Listen von bis zu fünf Instanztypen, um Kapazitätsengpässe zu vermeiden.
- OpenAI-kompatible APIs erlauben die Nutzung des
/openai/v1-Pfads für Chat Completions mit Streaming und vereinfachen die Migration bestehender Anwendungen. - Container-Caching reduziert die Startlatenz bei Auto-Scaling-Ereignissen.
- Ein neues Inferenz-Observability-Feature liefert über 100 Metriken via OpenTelemetry sowie ein vorgefertigtes CloudWatch Insights Dashboard für TTFT, ITL, KV-Cache-Auslastung und weitere Kennzahlen.
- Asynchrone Inferenz unterstützt nun Inline-Payloads bis 128.000 Bytes.
- Präfix-basiertes Routing maximiert die KV-Cache-Wiederverwendung und senkt die Latenz bei Prompt-Präfixen.
HyperPod Inference
Sechs wesentliche Erweiterungen für HyperPod Inference wurden vorgestellt:
- Ein vereinfachter Inference Operator als EKS-Add-on ermöglicht die Bereitstellung von LLMs über eine einzelne Custom Resource Definition.
- Ein verwalteter gestufter KV-Cache mit intelligentem Routing (präfix-basiert, KV-basiert, Round-Robin) verbessert die Cache-Effizienz.
- Datenerfassung an drei Punkten (Endpoint, ALB, Model Pod) unterstützt Compliance und Monitoring ohne zusätzliche Sidecars.
- Disaggregiertes Prefill und Decode trennt die Phasen auf separate GPU-Pools mit KV-Cache-Übertragung via EFA und GPU-Direct RDMA.
- Neue Performance-Features integrieren den Hugging Face Hub, lokales NVMe Model Loading und Amazon Route 53 für benutzerdefinierte Domänen.
- Modell-Caching über zwei CRDs reduziert Kaltstarts auf HyperPod-Clustern.
Die 13 Funktionen decken den gesamten Inferenz-Stack von Bereitstellung über Skalierung bis Betrieb ab. AWS plant die Weiterentwicklung beider Pfade.
Quelle: AWS AI Blog
FAQ
Welche zwei Hauptbereitstellungspfade werden durch die Neuerungen adressiert?
Managed Endpoints für vollständig verwaltete Bereitstellung und Amazon SageMaker HyperPod Inference für Kubernetes-native Kontrolle über dedizierte GPU-Cluster.
Welche Metriken werden durch das neue Observability-Feature primär abgedeckt?
Performance-Metriken wie Time to First Token (TTFT) und Inter-Token Latency (ITL), Kapazitätskennzahlen sowie Zuverlässigkeitsaspekte.
Welche Funktion vereinfacht die LLM-Bereitstellung auf Kubernetes am stärksten?
Der vereinfachte Inference Operator als natives EKS-Add-on, der die Bereitstellung auf eine einzelne Custom Resource Definition reduziert.