#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Container-Caching in Amazon SageMaker AI: Bis zu 2x schnellere Modellskalierung

Amazon Web Services hat „Container Image Caching“ für Amazon SageMaker AI Inference angekündigt. Die Funktion wurde am 2. Dezember 2024 auf der AWS re:Invent 2024 vorgestellt.

Kern der Technologie

Das Container-Caching reduziert die End-to-End-Latenz bei Scale-out-Ereignissen für generative KI-Modelle. Es eliminiert den Engpass des Herunterladens großer Container-Images von Amazon ECR beim Start neuer Instanzen.

Messbare Leistungsverbesserungen

Die Funktion beschleunigt die End-to-End-Latenz bei Scale-out-Ereignissen um bis zu 2x. Bei Tests mit dem Llama 3.1 70B-Modell sank die Skalierungszeit von 379 Sekunden auf 166 Sekunden – eine Verbesserung von 56 %. Weitere Benchmarks zeigten eine Latenzreduzierung von bis zu 56 % beim Skalieren einer neuen Modellkopie und bis zu 30 % beim Hinzufügen einer Modellkopie auf einer neuen Instanz. Ein konkretes Beispiel mit dem Qwen3-8B-Modell auf einer ml.g6.2xlarge-Instanz reduzierte die Startlatenz von 525 Sekunden auf 258 Sekunden (51 % Verbesserung).

Technische Funktionsweise

Beim Start neuer Instanzen wird das Container-Image lokal zwischengespeichert. Dadurch entfällt der Pull von Amazon ECR. Gleichzeitig sinkt die Netzwerkkonkurrenz, sodass Modellartefakte schneller aus Amazon S3 geladen werden können. Ist kein Cache verfügbar, fällt SageMaker AI automatisch auf das direkte Herunterladen zurück.

Integration in bestehende Optimierungen

Container Image Caching bildet die dritte Säule der Auto-Scaling-Optimierungen in SageMaker AI:

  1. Sub-Minuten-Metriken (10-Sekunden-Intervalle) – bis zu 6x schnellere Erkennung von Skalierungsbedarf.
  2. Daten-Cache für Inferenzkomponenten-basierte Endpunkte (seit Ende 2023) – beschleunigt das Laden auf bereits laufenden Instanzen.
  3. Container Image Cache – eliminiert die Image-Pull-Zeit bei neuen Instanzen.

Unterstützung und Sicherheit

Die Funktion wird automatisch für Accelerator-Instanztypen aktiviert, funktioniert mit allen ECR-Images (auch benutzerdefiniert) und erfordert keine Änderungen am Container. Sie unterstützt LMI, Hugging Face TGI, PyTorch und NVIDIA Triton. Jeder Cache ist strikt einem einzelnen Kunden-Endpunkt zugeordnet und wird beim Löschen des Endpunkts automatisch entfernt.

Quelle: AWS AI Blog

FAQ

Was genau macht Container Image Caching?
Es speichert Container-Images lokal auf den Instanzen, sodass beim Scale-out das zeitaufwändige Herunterladen von ECR entfällt.

Für welche Instanztypen ist die Funktion verfügbar?
Sie wird für Accelerator-Instanztypen auf SageMaker-Inferenz-Endpunkten automatisch aktiviert.

Beeinträchtigt das Caching die Mandantenisolation?
Nein. Jeder Cache ist einem einzelnen Kunden-Endpunkt gewidmet und wird nicht über Konten oder Endpunkte hinweg geteilt.