#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Fine-Tuning von NVIDIA Nemotron 3 Modellen mit Amazon SageMaker AI Serverless Model Customization

Fine-Tuning von NVIDIA Nemotron 3 Modellen mit Amazon SageMaker AI Serverless Model Customization

Amazon Web Services und NVIDIA haben die Unterstützung für die NVIDIA Nemotron 3 Modelle in der serverlosen Modell-Anpassungsfunktion von Amazon SageMaker AI erweitert. Unternehmen können damit Foundation Models mit domänenspezifischen Daten feinabstimmen, ohne eigene GPU-Infrastruktur verwalten zu müssen.

Serverlose Modell-Anpassung

Die Amazon SageMaker AI Serverless Model Customization Funktion übernimmt die Bereitstellung und Orchestrierung der Trainingsinfrastruktur vollständig. Nutzer konzentrieren sich ausschließlich auf die Bereitstellung von Trainingsdaten und die Evaluierung der Ergebnisse. Die Abrechnung erfolgt rein nutzungsbasiert.

Die Funktion ist in den Regionen US East (N. Virginia), US West (Oregon), Asia Pacific (Tokyo) und EU (Ireland) verfügbar. Sie unterstützt neben Nemotron 3 auch Modelle wie Amazon Nova, Llama, Qwen, DeepSeek und GPT-OSS.

Unterstützte Fine-Tuning-Techniken für Nemotron 3

SageMaker AI bietet für die Nemotron 3 Modelle drei zentrale Anpassungsmethoden:

Supervised Fine-Tuning (SFT): Das Modell lernt anhand beschrifteter Eingabe-Ausgabe-Paare. Diese Methode eignet sich besonders für domänenspezifische Frage-Antwort-Systeme, formatierte Tool-Aufrufe oder die Anpassung des Antwortstils.

Reinforcement Learning with Verifiable Rewards (RLVR): Das Modell generiert mehrere Antwortkandidaten, die durch eine verifizierbare Belohnungsfunktion bewertet werden. Besonders geeignet für Aufgaben mit objektiv überprüfbaren Zielen wie Tool-Aufrufgenauigkeit oder Code-Korrektheit.

Reinforcement Learning from AI Feedback (RLAIF): Ein separates KI-Modell bewertet die Ausgaben und liefert Feedback-Signale. Diese Methode ermöglicht die Optimierung von Ton, Hilfsbereitschaft und Sicherheit ohne umfangreiche menschliche Annotation.

Die NVIDIA Nemotron 3 Modellfamilie

Die Nemotron 3 Modelle basieren auf einer hybriden Mamba-Transformer Mixture-of-Experts (MoE)-Architektur. Diese kombiniert Mamba-2-Schichten für effiziente Sequenzverarbeitung, Transformer-Schichten für präzise Aufmerksamkeit und LatentMoE-Schichten, die Tokens vor der Weiterleitung an Experten komprimieren. Dadurch wird nur ein Bruchteil der Parameter pro Forward-Pass aktiviert.

Die Familie umfasst:

  • Nemotron 3 Nano: 30 Milliarden Gesamtparameter (3 Milliarden aktiv). Optimiert für hohe Recheneffizienz bei spezialisierten Aufgaben wie Codierung und Argumentation. Unterstützt native Kontextlängen bis zu 1 Million Tokens.
  • Nemotron 3 Super: 120 Milliarden Gesamtparameter (12 Milliarden aktiv). Entwickelt für komplexe Multi-Agenten-Systeme und anspruchsvolles Reasoning.
  • Nemotron 3 Ultra: Das größte Modell der Familie mit 550 Milliarden Parametern (55 Milliarden aktiv), ausgelegt für langlaufende Agenten-Workflows.

NVIDIA stellt Gewichte, umfangreiche Trainingsdaten und Rezepte unter der NVIDIA Nemotron Open Model License offen zur Verfügung. Die Modelle integrieren NeMo Gym für Multi-Environment Reinforcement Learning.

Bereitstellung der angepassten Modelle

Feinabgestimmte Modelle können über die SageMaker Studio Konsole oder das SageMaker Python SDK bereitgestellt werden. Mögliche Zielumgebungen sind SageMaker Inference-Endpunkte, Amazon Bedrock für serverlose Inferenz oder der Download der Gewichte aus Amazon S3 für selbstverwaltete Deployment.

Ein Beispiel zeigt die Bereitstellung eines feinabgestimmten Nemotron Nano 30B auf einer ml.g6e-Instanz, die mit NVIDIA L40S Tensor Core GPUs ausgestattet ist.

Quelle: AWS AI Blog

FAQ

Welche Fine-Tuning-Methoden werden für Nemotron 3 Modelle auf SageMaker AI unterstützt? Supervised Fine-Tuning (SFT), Reinforcement Learning with Verifiable Rewards (RLVR) und Reinforcement Learning from AI Feedback (RLAIF).

Welche Architektur nutzen die NVIDIA Nemotron 3 Modelle? Eine hybride Mamba-Transformer Mixture-of-Experts (MoE)-Architektur mit LatentMoE-Schichten, die nur einen Bruchteil der Parameter pro Durchlauf aktiviert.

In welchen AWS-Regionen ist die serverlose Modell-Anpassung für Nemotron 3 verfügbar? Derzeit in US East (N. Virginia), US West (Oregon), Asia Pacific (Tokyo) und EU (Ireland).