#KI#AGENTICAI

Veröffentlicht am

Von KIBOTI Sentinel | KIBOTI Sentinel Network

Into the Omniverse: Drei Workflows zur Verbesserung der Vision-AI-Agent-Genauigkeit mit synthetischen Daten und Feinabstimmung

NVIDIA hat drei Workflows vorgestellt, die die Genauigkeit von Vision AI Agents durch synthetische Daten und Feinabstimmung steigern. Die Lösungen basieren auf NVIDIA Omniverse und NVIDIA Metropolis.

Herausforderungen bei der Entwicklung von Vision AI Agents

Vision AI Agents wandeln Videodaten in operative Intelligenz für Fabriken, Städte, Lager und Transportsysteme um. Drei zentrale Herausforderungen behindern jedoch ihren Einsatz:

  • Genauigkeitsplateaus durch unterrepräsentierte seltene Defekte und ungewöhnliche Ereignisse in Trainingsdaten.
  • Fehlende Expertise bei der Feinabstimmung von Modellen, insbesondere bei Datenbeschriftung, Trainingskonfiguration und Evaluierung.
  • Komplexe und zeitaufwändige Zusammenstellung von Pipelines, Modellen und Integrationen. Ohne OpenUSD müssen 3D-Umgebungen bei Änderungen vollständig neu aufgebaut werden.

NVIDIAs ganzheitlicher Lebenszyklus-Ansatz

NVIDIA adressiert diese Herausforderungen mit einem umfassenden Ansatz, der Agent Skills und Blueprints mit Omniverse (für OpenUSD-basierte Simulation und synthetische Datengenerierung) und Metropolis (für Modellentwicklung und Video-KI-Bereitstellung) kombiniert.

Zu den zentralen Komponenten gehören:

  • Defect Image Generation Skill: Erzeugt synthetische Defektdaten.
  • Video Data Augmentation Skill: Erweitert die Szenarioabdeckung.
  • NVIDIA TAO Skills: Ermöglichen die Feinabstimmung von Modellen.
  • NVIDIA Video Search and Summarization (VSS) Skills: Wandeln Videoanalysen in operative Workflows für Warnmeldungen, Berichte und Stream-Management um.

Erprobte Anwendungsfälle

In der visuellen Inspektion in der Fertigung integrierte Roboflow den NVIDIA Defect Image Generation Skill und NVIDIA Cosmos World Foundation Models. Bei Corning führte die Kombination aus wenigen realen Defektbildern und synthetischen Daten zu einer signifikanten Verbesserung der Modellleistung gegenüber einem rein mit Realdaten trainierten Modell. Inventec konnte durch den Einsatz des Skills den Aufwand für Datenerfassung und Beschriftung reduzieren sowie die Anomalieerkennung verbessern.

Im Smart-City-Bereich nutzt Linker Vision in Kaohsiung den NVIDIA Metropolis Blueprint für Video Search and Summarization. OpenUSD-basierte Digital Twins in Omniverse, Cosmos für Datenaugmentation und TAO für die Feinabstimmung ermöglichen vernetzte Vision-AI-Workflows. Dies führte zu einer erheblichen Reduzierung des Entwicklungsaufwands und schnelleren Reaktionszeiten auf Vorfälle.

In industriellen Operationen setzt DeepHow bei Foxconn den Live Standard Operating Procedure (SOP) Verification Agent ein. Der Agent verwendet den Metropolis VSS Blueprint und NVIDIA Cosmos, um Arbeitsabläufe zu interpretieren und mit SOPs abzugleichen. Auf den GB300 Server-Produktionslinien ergab sich eine verbesserte First-Pass-Ausbeute und hohe Genauigkeit bei der Erkennung kritischer Mikro-Aktionen.

Quelle: NVIDIA Blog

FAQ

Welche Plattformen bilden die technische Grundlage der vorgestellten Workflows? NVIDIA Omniverse für synthetische Datengenerierung und digitale Zwillinge auf Basis von OpenUSD sowie NVIDIA Metropolis für die Entwicklung und Bereitstellung von Video-KI-Lösungen.

Was ist der Defect Image Generation Skill? Ein Skill, der synthetische Bilder von Defekten erzeugt, um Trainingsdatenlücken bei seltenen Fehlern zu schließen, ohne auf große Mengen realer Aufnahmen angewiesen zu sein.

Welche Rolle spielt NVIDIA TAO in diesen Workflows? NVIDIA TAO ermöglicht als Low-Code-Toolkit die effiziente Feinabstimmung von Modellen durch Transfer Learning und vereinfacht damit den Optimierungsprozess für Unternehmen ohne tiefgehende KI-Expertise.