Im Quellenvergleich

Nvidias neue KI-Modelle und Router

5 Quellen · 5 Meldungen · Stand 12.08.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Nvidia hat Nemotron 3.5 Lightning vorgestellt, ein offenes Modell mit 30 Milliarden Parametern für KI-Agenten. Das Modell ist der Nachfolger des Nemotron 3 Nano 30B A3B und behält dessen hybride Mamba-Transformer-Architektur. Es wurde per Destillation aus größeren Nemotron-Modellen trainiert. Laut Nvidia generiert es Antworten bis zu viermal schneller und erledigt Agentenaufgaben rund 30 Prozent schneller als vergleichbare offene Modelle. Das Modell erreicht im Artificial Analysis Intelligence Index 24 Punkte. Zusätzlich veröffentlichte Nvidia NeMo Switchyard, eine Open-Source-Bibliothek, die jeden Schritt eines Agenten-Workflows an das passende Modell weiterleitet. Laut Nvidia senkt Switchyard die Benchmark-Kosten auf etwa ein Drittel der Kosten von Opus 4.8. Die Gewichte stehen ab sofort zur Verfügung. Die Quellen berichten weitgehend übereinstimmend. Das Modell hat 31,6 Milliarden Gesamtparameter, davon 3,6 Milliarden aktiv. Es verarbeitet nur Text und hat ein Kontextfenster von einer Million Token. Die Ausgabegeschwindigkeit liegt bei etwa 670 Token pro Sekunde. Nvidia stellt neben den Gewichten auch Trainingsdaten und Rezepte unter der Lizenz OpenMDW-1.1 bereit. Das Modell ist für dauerhaft laufende KI-Agenten in Unternehmen optimiert. Es nutzt eine Mixture-of-Experts-Architektur (MoE) und kombiniert Mamba-2-State-Space-Layer, MoE-Routing und selektive Attention-Layer. Laut Nvidia läuft es auf einer einzigen GPU in einem normalen PC. Firmen wie CrowdStrike, CodeRabbit und Harvey haben es bereits getestet. Nvidia arbeitete mit Partnern wie CodeRabbit und Harvey am Post-Training. Serverless-Inference bieten unter anderem DeepInfra, Fireworks und CoreWeave an.

Aktualisierungen
12.08.2026
05:06Das Modell hat 31,6 Milliarden Gesamtparameter, davon 3,6 Milliarden aktiv.
Es verarbeitet nur Text und hat ein Kontextfenster von einer Million Token.
Die Ausgabegeschwindigkeit liegt bei etwa 670 Token pro Sekunde.
Nvidia stellt neben den Gewichten auch Trainingsdaten und Rezepte unter der Lizenz OpenMDW-1.1 bereit.
12:08Das Modell ist für dauerhaft laufende KI-Agenten in Unternehmen optimiert.
Es nutzt eine Mixture-of-Experts-Architektur (MoE) und kombiniert Mamba-2-State-Space-Layer, MoE-Routing und selektive Attention-Layer.
Laut Nvidia läuft es auf einer einzigen GPU in einem normalen PC.
Firmen wie CrowdStrike, CodeRabbit und Harvey haben es bereits getestet.
Nvidia arbeitete mit Partnern wie CodeRabbit und Harvey am Post-Training.
Serverless-Inference bieten unter anderem DeepInfra, Fireworks und CoreWeave an.
Worin sie sich unterscheidenAnzahl der Parameter·Vergleich mit Qwen3.6-35B·Positionierung im Vergleich zu anderen Modellen+7 weitere
Anzahl der Parameter
  • Das Modell hat 30 Milliarden Parameter.1
  • Das Modell hat 300 Milliarden Parameter.2
Vergleich mit Qwen3.6-35B
  • Das Modell erledigt Agentenaufgaben rund 30 Prozent schneller als Qwen3.6-35B bei gleicher Genauigkeit.1
  • Eine Aufgabe aus dem Intelligence Index dauert mit dem Modell etwa 0,5 Minuten, mit Qwen3.6 35B A3B rund 3,5 Minuten.3
Positionierung im Vergleich zu anderen Modellen
  • Das Modell erreicht im Artificial Analysis Intelligence Index 24 Punkte und liegt damit hinter Nemotron 3 Super, Gemma 4 31B und anderen.1
  • Das Modell erreicht 24 Punkte und liegt damit auf dem Niveau von OpenAIs gpt-oss-120b (24) und knapp hinter Nvidias eigenem Nemotron 3 Super (26), das etwa viermal so groß ist.3
  • Das Modell erreicht 24 Punkte, was dem Score von OpenAIs gpt-oss-120b entspricht, das etwa viermal so viele Parameter hat.2
Konkurrenz für Switchyard
  • Switchyard konkurriert mit Not Diamond und RouteLLM, die keine eigenen Modelle anbieten.1
Kosteneinsparungen durch Switchyard
  • Laut internen Tests von Nvidia senkt Switchyard die Kosten auf etwa ein Drittel dessen, was die alleinige Nutzung von Opus 4.8 von Anthropic kosten würde.4
  • LangChain meldete eine Kostensenkung von 74 Prozent bei 145 Aufgaben, Ramp sparte 58 Prozent Kosten und 33 Prozent Laufzeit, Cognition reduzierte die mittleren Kosten um 28 Prozent.1
Strategischer Kontext der Veröffentlichung
  • Nvidia verdient Geld mit Hardware, nicht mit Modellen; günstigere KI soll mehr Entwickler anlocken, die dann Nvidia-GPUs brauchen.4
  • CEO Jensen Huang warb zuvor in einem offenen Brief gegen verfrühte Beschränkungen für offene KI.4
  • Einen Tag zuvor hatte Meta sein Programmiermodell Muse Spark veröffentlicht; CEO Mark Zuckerberg sprach sich ebenfalls für offene Modelle aus.4
Einsatzbereich des ModellsDas Modell ist für dauerhaft laufende KI-Agenten gedacht.25
Geschwindigkeitsmessung
  • In Vorabtests erreicht das Modell fast 670 Token pro Sekunde, fast doppelt so schnell wie Googles Gemini 3.5 Flash-Lite (386 Token/s).3
Agentische Benchmarks
  • Im GDPval-AA v2 erreicht das Modell einen Elo-Wert von 824, ein Zugewinn von 334 Punkten gegenüber dem Vorgänger, und übertrifft damit gpt-oss-120b (800) und Nemotron 3 Super (698).3
  • Im Terminal-Bench v2.1 steigt der Score von 7 auf 24,3 Prozent.3
Router-Agent-Training
  • Ein Router-Agent kann mit dem Standard-Trainingsrezept für 85 Dollar in etwa zwei Stunden gebaut werden.1

Quellen (5)

Vollständige Übersicht mit allen Meldungen öffnen →