#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

GEM Training: Wie Meta die Effizienz seines LLM-skaligen Werbemodells verdoppelte

Meta hat die Trainingseffizienz seines zentralen Werbe-Fundamentmodells GEM (Generative Ads Recommendation Model) erheblich gesteigert. Das Modell, das Anzeigenempfehlungen auf Facebook und Instagram antreibt, arbeitet im Maßstab großer Sprachmodelle und kombiniert Billionen dünnbesetzte Embedding-Parameter mit Milliarden dichten Parametern.

Durch einen umfassenden Co-Design-Ansatz über Hardware- und Software-Ebenen hinweg konnte Meta die End-to-End-Trainingseffizienz innerhalb eines Jahres verdoppeln, gemessen in Model FLOPs Utilization (MFU). Gleichzeitig vervierfachte sich die Gesamtzahl der eingesetzten Trainings-FLOPs.

Kernherausforderungen von LLM-skaligen Empfehlungssystemen

Im Gegensatz zu klassischen LLM-Trainings leiden Empfehlungsmodelle unter variablen Sequenzlängen („jagged inputs“), die bei naiver Verarbeitung zu hohem Padding-Overhead führen. Hinzu kommen speichergebundene Operationen, ungleichmäßige Lastverteilung und hoher Kommunikationsaufwand bei der Skalierung auf mehrere Tausend GPUs.

Technische Innovationen

Compute-Effizienz: Meta entwickelte eine maßgeschneiderte Kernel-Bibliothek, darunter Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA) und BlockAttention. Diese Kernel eliminieren Padding-Overhead, vereinheitlichen asymmetrische Aufmerksamkeitsmuster und reduzieren die quadratischen Kosten langer Sequenzen. Ergänzt wurde dies durch gemischtes Ultra-Low-Precision-Training mit MXFP8 für Attention- und MLP-Schichten, das numerische Stabilität durch Random Hadamard Transforms und selektive Präzision sicherstellt.

Skalierungseffizienz: Eine 5D-Parallelisierungsstrategie kombiniert 3D-Parallelisierung für dichte Parameter mit Fully Sharded 2D Model Parallelism für die riesigen Embedding-Tabellen. NCCLX ermöglicht SM-freie Kommunikation über NVLink und RDMA. Compiler-basiertes Automatic Activation Checkpointing, Aktivierungsquantisierung und Base Batch Shuffling verbessern Speichereffizienz und Lastbalance.

Diese Maßnahmen führten zu signifikanten Steigerungen der lokalen MFU und des gesamten Trainingsdurchsatzes.

Quelle: Meta Engineering

FAQ

Welches Modell wurde optimiert?
Das Generative Ads Recommendation Model (GEM), das zentrale Fundamentmodell für Werbeempfehlungen auf Meta-Plattformen.

Welche Effizienzsteigerung wurde erreicht?
Die End-to-End-Trainingseffizienz (MFU) wurde verdoppelt, während die eingesetzten Trainings-FLOPs im gleichen Zeitraum vervierfacht wurden.

Welcher Ansatz ermöglichte diese Fortschritte?
Ein systematisches Co-Design über Kernel, Präzision, Parallelisierung, Netzwerk und Speichermanagement, das speziell auf die hybride Architektur und „jagged“ Datencharakteristik von Empfehlungssystemen zugeschnitten ist.