#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Amazon SageMaker Inference: 13 neue Funktionen im Rückblick 2026

Amazon SageMaker Inference hat im Berichtszeitraum Januar bis September 2026 insgesamt 13 neue Funktionen für die Inferenz generativer KI-Modelle eingeführt.

Die Neuerungen verteilen sich auf zwei Bereitstellungspfade: vollständig verwaltete SageMaker Endpoints und Kubernetes-native Amazon SageMaker HyperPod Inference.

Managed Endpoints

AWS hat sieben zentrale Verbesserungen für Managed Endpoints veröffentlicht:

  • Inferenz-Empfehlungen und Benchmarking automatisieren die Auswahl von Instanztyp, Serving-Container und Optimierungseinstellungen auf Basis definierter Leistungsziele.
  • Kapazitätsbewusste Instance Pools ermöglichen die Definition priorisierter Listen von bis zu fünf Instanztypen, um Kapazitätsengpässe zu vermeiden.
  • OpenAI-kompatible APIs erlauben die Nutzung des /openai/v1-Pfads für Chat Completions mit Streaming und vereinfachen die Migration bestehender Anwendungen.
  • Container-Caching reduziert die Startlatenz bei Auto-Scaling-Ereignissen.
  • Ein neues Inferenz-Observability-Feature liefert über 100 Metriken via OpenTelemetry sowie ein vorgefertigtes CloudWatch Insights Dashboard für TTFT, ITL, KV-Cache-Auslastung und weitere Kennzahlen.
  • Asynchrone Inferenz unterstützt nun Inline-Payloads bis 128.000 Bytes.
  • Präfix-basiertes Routing maximiert die KV-Cache-Wiederverwendung und senkt die Latenz bei Prompt-Präfixen.

HyperPod Inference

Sechs wesentliche Erweiterungen für HyperPod Inference wurden vorgestellt:

  • Ein vereinfachter Inference Operator als EKS-Add-on ermöglicht die Bereitstellung von LLMs über eine einzelne Custom Resource Definition.
  • Ein verwalteter gestufter KV-Cache mit intelligentem Routing (präfix-basiert, KV-basiert, Round-Robin) verbessert die Cache-Effizienz.
  • Datenerfassung an drei Punkten (Endpoint, ALB, Model Pod) unterstützt Compliance und Monitoring ohne zusätzliche Sidecars.
  • Disaggregiertes Prefill und Decode trennt die Phasen auf separate GPU-Pools mit KV-Cache-Übertragung via EFA und GPU-Direct RDMA.
  • Neue Performance-Features integrieren den Hugging Face Hub, lokales NVMe Model Loading und Amazon Route 53 für benutzerdefinierte Domänen.
  • Modell-Caching über zwei CRDs reduziert Kaltstarts auf HyperPod-Clustern.

Die 13 Funktionen decken den gesamten Inferenz-Stack von Bereitstellung über Skalierung bis Betrieb ab. AWS plant die Weiterentwicklung beider Pfade.

Quelle: AWS AI Blog

FAQ

Welche zwei Hauptbereitstellungspfade werden durch die Neuerungen adressiert?
Managed Endpoints für vollständig verwaltete Bereitstellung und Amazon SageMaker HyperPod Inference für Kubernetes-native Kontrolle über dedizierte GPU-Cluster.

Welche Metriken werden durch das neue Observability-Feature primär abgedeckt?
Performance-Metriken wie Time to First Token (TTFT) und Inter-Token Latency (ITL), Kapazitätskennzahlen sowie Zuverlässigkeitsaspekte.

Welche Funktion vereinfacht die LLM-Bereitstellung auf Kubernetes am stärksten?
Der vereinfachte Inference Operator als natives EKS-Add-on, der die Bereitstellung auf eine einzelne Custom Resource Definition reduziert.