#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Präfix-sensitives Routing reduziert LLM-Latenz auf Amazon SageMaker Inference

Amazon SageMaker Inference hat eine neue Routing-Strategie eingeführt, die das skalierte Serving von Large Language Models (LLMs) auf Systemebene verbessert.

Systemische Herausforderung im verteilten LLM-Serving

In produktiven LLM-Anwendungen wie RAG-Systemen oder conversational Agents besteht eine Anfrage typischerweise aus einem statischen Präfix (System-Prompt, Dokumentenkontext oder Konversationshistorie) und einem variablen Suffix (aktuelle Nutzereingabe). Moderne Serving-Frameworks wie vLLM nutzen Präfix-Caching des Key-Value-Caches, um redundante Berechnungen zu vermeiden. Sobald die Last jedoch über mehrere Instanzen verteilt wird, zerfällt die Cache-Effizienz, da identische Präfixe zufällig auf unterschiedliche GPUs gelenkt werden.

Architektur des Prefix-aware Routing

Die neue „Prefix-aware routing“-Funktion auf SageMaker Real-time Inference analysiert den Anfang jeder Anfrage und leitet alle Requests mit identischem Präfix konsistent auf dieselbe Inferenz-Instanz weiter. Dadurch kann der KV-Cache auf Instanzebene mit hoher Trefferquote wiederverwendet werden. Das Routing findet vollständig auf der Endpoint-Ebene statt und erfordert keine Änderungen am Modell-Container oder am Serving-Framework.

Die Funktion wird über die Endpoint-Konfiguration aktiviert, indem RoutingStrategy auf "PREFIX_AWARE" gesetzt wird. Die Parameter PrefixLength und ConcurrencyThreshold steuern Präfix-Erkennung und Überlastungsschutz.

Schutzmechanismen für strukturelle Integrität

  • Bei Überlastung einer Instanz werden Anfragen an weniger belastete Instanzen umgeleitet.
  • Die maximale Parallelität pro Instanz ist konfigurierbar.
  • Beim horizontalen Skalieren (Hinzufügen oder Entfernen von Instanzen) bleibt die Zuordnung der meisten Präfixe stabil, um Cache-Invalidierungen zu minimieren.
  • Für Multi-Tenant-Umgebungen stehen optionale Identifier (X-Amzn-SageMaker-Prefix-Aware-Id bzw. prompt_cache_key) zur Isolation von Präfixen unterschiedlicher Mandanten zur Verfügung.

Anwendungsfälle in resilienten Systemen

Die Technik entfaltet besondere Wirkung bei Retrieval Augmented Generation mit wiederkehrenden Dokumenten, bei mehrstufigen Konversationen, bei templatisierten Agenten mit langen System-Prompts sowie bei Code-Vervollständigungswerkzeugen, die Dateikontext wiederverwenden.

Quelle: AWS AI Blog

FAQ

Welche Voraussetzung muss erfüllt sein, damit Prefix-aware routing wirkt?
Das Serving-Framework (z. B. vLLM) muss Präfix-Caching aktiviert haben und es müssen mindestens zwei Instanzen im Endpoint betrieben werden.

Entsteht durch die zusätzliche Routing-Logik spürbarer Overhead?
Der Routing-Overhead liegt im Bereich von 1,3–1,9 Millisekunden pro Anfrage und bleibt im Vergleich zur typischen Modell-Time-to-First-Token vernachlässigbar.

Ist die Funktion für OpenAI-kompatible Endpoints nutzbar?
Ja. Über das Feld prompt_cache_key können Präfixe auch bei OpenAI-kompatibler API isoliert und konsistent geroutet werden.