Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert2 Min.

NVIDIA stellt Nemotron 3.5 Lightning und Routing-Werkzeug Switchyard vor

Mit Nemotron 3.5 Lightning und NeMo Switchyard bringt NVIDIA ein hochspezialisiertes MoE-Modell sowie eine intelligente Routing-Bibliothek für latenzkritische KI-Agenten auf den Markt.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Das US-Technologieunternehmen NVIDIA hat am 11. August 2026 seine Modellfamilie Nemotron 3 um das neue Leichtgewicht Nemotron 3.5 Lightning erweitert. Die Veröffentlichung richtet sich primär an Entwickler von autonomen KI-Agenten, die auf schnelle Reaktionszeiten und permanente Verfügbarkeit angewiesen sind. Neben der Bereitstellung des Modells veröffentlichte NVIDIA zeitgleich die quelloffene Bibliothek NeMo Switchyard zur dynamischen Anfragesteuerung. Die Ankündigung unterstreicht den wandelnden Schwerpunkt der Branche von reinen Sprachmodellen hin zu spezialisierten Agenten-Workflows.

Das Modell Nemotron 3.5 Lightning basiert auf einer Mixture-of-Experts-Architektur mit insgesamt 30 Milliarden Parametern. Trotz des großen Parameterumfangs werden pro generiertem Token lediglich drei Milliarden Parameter aktiviert, was den Rechenaufwand drastisch reduziert. Zudem unterstützt das Modell ein extrem großes Kontextfenster von bis zu einer Million Tokens. Diese Kombination ermöglicht es, komplexe Dokumente oder lange Konversationsverläufe bei minimaler Latenz lokal oder auf eigener Infrastruktur zu verarbeiten.

NVIDIA zielt mit der Modellarchitektur gezielt auf lückenlos laufende Multi-Step-Workflows und den aktiven Werkzeugeinsatz durch KI-Agenten ab. Entwickler erhalten damit ein Werkzeug, das insbesondere bei der Verknüpfung von API-Aufrufen und automatisierten Entscheidungen hohe Geschwindigkeiten erzielt. Zur Vereinfachung des lokalen Einsatzes steht das Modell direkt über die beliebte Entwicklerplattform Ollama zur Verfügung. Dies erlaubt Teams das schmerzfreie Testen und Bereitstellen auf eigener Hardware ohne zwingende Cloud-Anbindung.

Ergänzt wird die Veröffentlichung durch die quelloffene Bibliothek NeMo Switchyard, die als intelligentes Kontrollzentrum für Modell-Netzwerke fungiert. Das Werkzeug steuert eingehende Anfragen dynamisch zwischen verschiedenen proprietären und quelloffenen Sprachmodellen im Hintergrund. So können einfache Aufgaben kostengünstig an kleinere Open-Source-Modelle geleitet werden, während hochkomplexe Anfragen an leistungsstarke Cloud-Systeme gehen. Diese flexible Anfragenverteilung senkt Betriebskosten signifikant und optimiert gleichzeitig die Gesamtlatenz der Systeme.

Die doppelte Veröffentlichung spiegelt einen wachsenden Trend in der KI-Infrastruktur wider, bei dem Systemarchitektur und Modellauswahl zusammenwachsen. Anstatt ein einzelnes monolithisches Modell für alle Aufgaben einzusetzen, setzen Unternehmen zunehmend auf verteilte Orchestrierung. Die Kombination aus spezialisierten MoE-Agentenmodellen und intelligentem Routing ermöglicht maßgeschneiderte Architekturen für Unternehmenseinsätze. NVIDIA festigt damit seine Rolle als wichtiger Softwarelieferant im Bereich der praktischen Agentenautomatisierung.

Was heißt das für Sie?

Für Entwickler und Unternehmen bedeuten diese Werkzeuge eine spürbare Senkung der Infrastrukturkosten bei der Erstellung von KI-Agenten. Durch die Kombination aus lokal ausführbaren MoE-Modellen und intelligentem Anfrage-Routing lassen sich Reaktionszeiten deutlich verkürzen. Teams erhalten dadurch mehr Flexibilität, um sensible Prozesse lokal abzuwickeln und teure Cloud-APIs nur bei Bedarf anzusteuern.

Belege

Gut belegt
73/100
  • NVIDIA hat am 11. August 2026 die Modellfamilie Nemotron 3 um das Modell Nemotron 3.5 Lightning erweitert.

    belegt
  • Nemotron 3.5 Lightning verfügt über 30 Milliarden Gesamtparameter mit 3 Milliarden aktiven Parametern pro Token sowie ein Kontextfenster von 1 Million Tokens.

    belegt
  • Das Modell ist speziell für dauerhaft laufende, latenzkritische KI-Agenten ausgelegt und direkt über Ollama lokal ausführbar.

    eine Quelle
  • Mit NeMo Switchyard veröffenlichte NVIDIA zeitgleich eine Open-Source-Bibliothek für intelligentes Request-Routing zwischen proprietären und Open-Source-Modellen.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 13. August 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
3
Verifizierte Aussagen
2 / 4
Beleg-Score
73Gut belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?