NVIDIA treibt die strukturelle Integrität lokaler KI-Systeme durch neue Open-Weights-Modelle und intelligente Routing-Schichten voran.
Das Unternehmen erweitert sein Open-Source-Ökosystem mit zwei zentralen Komponenten: dem Nemotron 3.5 Lightning Modell und der Routing-Bibliothek NeMo Switchyard. Beide sind explizit für den Bau resilienter, lokal ausführbarer intelligenter Agenten konzipiert.
Nemotron 3.5 Lightning
Nemotron 3.5 Lightning ist ein 30-Milliarden-Parameter Mixture-of-Experts-Modell mit 3 Milliarden aktiven Parametern. Es bildet das kleinste Mitglied der Nemotron-3-Familie und verwendet eine hybride Mamba-Transformer-Architektur mit latenten MoE-Schichten.
Das Modell ist speziell für die Ausführungsschicht autonomer Agenten optimiert. Es kombiniert hohe Inferenzgeschwindigkeit mit der Fähigkeit, spezialisierte Aufgaben zuverlässig zu bearbeiten. Entwickler können es als Open-Weights-Modell mit eigenen Datensätzen feinabstimmen, um es an fachspezifische Domänen wie Coding, Design oder persönliche Assistenz anzupassen.
Es ist für den lokalen Betrieb auf NVIDIA RTX PCs, Jetson, DGX Spark sowie auf skalierbaren Systemen bis hin zu Rechenzentren ausgelegt. Die Bereitstellung wird durch Partner wie Ollama, llama.cpp, vLLM, LM Studio und Unsloth in optimierten Formaten (NVFP4, GGUF) unterstützt. Das Modell ist zudem als NVIDIA NIM Microservice verfügbar.
NeMo Switchyard
NeMo Switchyard ist eine Open-Source-Routing-Bibliothek, die als Rust-Proxy und -Bibliothek für LLM-Traffic dient. Sie ermöglicht die dynamische Weiterleitung einzelner Schritte eines Agenten-Workflows an das jeweils geeignetste Modell – basierend auf Genauigkeit, Geschwindigkeit und Kosten.
Die Bibliothek unterstützt verschiedene Routing-Strategien, darunter LLM-Klassifikator-Router, Stage Router und Escalation Router. Sie übersetzt zwischen den Protokollen OpenAI Chat, Anthropic Messages und OpenAI Responses. Durch gezielte Weiterleitung kann die Abhängigkeit von einzelnen Frontier-Modellen reduziert werden, während die Gesamtleistung des Agenten auf hohem Niveau bleibt.
Die Bibliothek ist auf GitHub verfügbar und wird bereits von Unternehmen wie Cognition, Nous Research, LangChain und LiteLLM in deren Entwicklungs-Workflows eingesetzt.
Lokale KI-Initiative und Infrastruktur
NVIDIA positioniert diese Veröffentlichungen im Rahmen seiner Local AI Initiative, die Open-Source-Communities, Entwicklertools und beschleunigte Hardware zusammenbringt. Parallel hat das Unternehmen Absichtserklärungen mit führenden Finanzinstituten unterzeichnet, um Kapital für den Ausbau von KI-Infrastruktur zu mobilisieren.
Quelle: NVIDIA Blog
FAQ
Welche Architektur nutzt Nemotron 3.5 Lightning?
Es basiert auf einer hybriden Mamba-Transformer-Architektur mit latenten Mixture-of-Experts-Schichten.
Wofür ist NeMo Switchyard konzipiert?
Als Routing-Bibliothek leitet es einzelne Schritte von Agenten-Workflows automatisch an das jeweils passende Modell weiter, um Kosten und Leistung zu optimieren.
Auf welchen Systemen kann Nemotron 3.5 Lightning lokal ausgeführt werden?
Es läuft auf NVIDIA RTX PCs, Jetson-Plattformen, DGX Spark sowie auf Workstations und Rechenzentren.
Ist das Modell für kommerzielle Anpassungen freigegeben?
Ja. Als Open-Weights-Modell kann es mit eigenen Daten feinabgestimmt und für spezifische Domänen angepasst werden.
