#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Qwen3.8-2.4T-A95B auf Amazon SageMaker HyperPod mit vLLM bereitgestellt

Qwen3.8-2.4T-A95B auf Amazon SageMaker HyperPod mit vLLM bereitgestellt

Das Open-Weight-Modell Qwen3.8-2.4T-A95B des Alibaba Qwen-Teams wurde am 12. August 2026 auf Hugging Face und ModelScope veröffentlicht. AWS hat nun eine Referenzarchitektur zur Bereitstellung dieses Modells auf Amazon SageMaker HyperPod unter Verwendung von vLLM vorgestellt.

Modellarchitektur

Qwen3.8-2.4T-A95B ist ein spärliches Mixture-of-Experts-Modell (MoE) mit insgesamt 2,4 Billionen Parametern, von denen 95 Milliarden pro Token aktiviert werden. Die Architektur umfasst 512 geroutete und einen geteilten Experten, wobei 10 geroutete Experten pro Token aktiv sind.

Die Attention-Schicht ist hybrid aufgebaut: Von 92 Schichten sind 69 als Gated DeltaNet (lineare Attention mit begrenztem rekurrentem Zustand) und 23 als Gated Attention implementiert. Dieses Verhältnis ermöglicht eine skalierbare Verarbeitung von Kontexten bis zu einer Million Token bei kontrolliertem Speicherbedarf.

Das native Kontextfenster beträgt 262.144 Token und ist auf bis zu eine Million Token erweiterbar. Die maximale Ausgabelänge liegt bei 128.000 Token.

Kernfähigkeiten

Das Modell ist für anspruchsvolle agentische und Reasoning-Aufgaben konzipiert. Es bietet integrierte Reasoning-Steuerung über den Parameter reasoning_effort (low, medium, high), OpenAI-kompatibles Tool Calling sowie native Multi-Token Prediction (MTP). Letztere ermöglicht spekulatives Decoding ohne separates Draft-Modell und verbessert Inferenzgeschwindigkeit sowie Durchsatz.

Bereitstellung auf SageMaker HyperPod

Die Referenzimplementierung nutzt SageMaker HyperPod mit Amazon EKS als Steuerungsebene und vLLM als Serving-Engine. Die Bereitstellung erfolgt auf ml.p6-b300-Instanzen mit 8x NVIDIA B300 Blackwell Ultra GPUs. Durch NVFP4-Quantisierung (W4A4) wird das Modell auf etwa 1,2 TB komprimiert und passt damit in den verfügbaren GPU-Speicher.

Leistungsoptimierungen

Die Kombination aus Tensor Parallelism, Expert Parallelism und Multi-Token Prediction führt zu messbaren Verbesserungen bei Time-to-First-Token, Anfragelatenz und Ausgabedurchsatz im Vergleich zur reinen Tensor-Parallelism-Baseline. Weitere Optimierungen umfassen Prefix Caching, gezieltes MTP-Tuning sowie die Anpassung von Batching- und Speicherparametern in vLLM.

Quelle: AWS AI Blog

FAQ

Welches Quantisierungsverfahren wird für Qwen3.8-2.4T-A95B auf den Blackwell-GPUs eingesetzt?
NVFP4 (W4A4), ein 4-Bit-Floating-Point-Format der NVIDIA Blackwell-Architektur, das Genauigkeit bei niedriger Präzision bewahrt.

Welche Rolle spielt native Multi-Token Prediction (MTP) in der Optimierung?
MTP ermöglicht spekulatives Decoding direkt innerhalb der Modellgewichte und reduziert insbesondere die Time-to-First-Token erheblich.

Warum ist SageMaker HyperPod für den Betrieb solcher Modelle geeignet?
HyperPod bietet automatisierte Orchestrierung, kontinuierliche Knotenüberwachung, automatische Fehlerbehebung und resiliente Skalierung für große Foundation Models.