NVIDIA stellt offene KI-Modelle Nemotron 3 vor

NVIDIA stellt offene KI-Modelle Nemotron 3 vor

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
19. 12. 2025
4 Minuten Lesezeit
NVIDIA stellt offene KI-Modelle Nemotron 3 vor

Künstliche Intelligenz (KI) arbeitet wie ein Team intelligenter Helfer, die bei komplexen Aufgaben zusammenarbeiten. Genau das ermöglicht die neue Modellfamilie Nvidia Nemotron 3. Diese Reihe offener Modelle ist in drei Größen erhältlich: Nano, Super und Ultra. Sie wurde für die Entwicklung spezialisierter agentischer KI-Systeme konzipiert. Nvidia kündigte sie am 15. Dezember 2025 an und konzentriert sich dabei auf hohe Effizienz und Genauigkeit. Dies hilft Entwicklern, Systeme zu entwickeln, die lange Kontexte und viele Agenten gleichzeitig bewältigen können.

Die Nemotron-3-Familie löst Probleme wie einen hohen Rechenleistungsverbrauch oder den Verlust von Zusammenhängen bei langen Aufgaben. Die Modelle sind offen, was bedeutet, dass Entwickler ihre Funktionsweise einsehen, sie anpassen und überall einsetzen können. Jensen Huang, Gründer und CEO von Nvidia, betonte, dass offene Innovation die Grundlage für Fortschritte bei KI sei. Die Modelle unterstützen Bestrebungen nach souveräner KI in europäischen Ländern oder Südkorea, wo Unternehmen Systeme wünschen, die an ihre Daten und Vorschriften angepasst sind.

Was Nemotron 3 Nano bietet

Nemotron 3 Nano ist das erste Modell der Familie, das ab sofort verfügbar ist. Es verfügt insgesamt über 30 Milliarden Parameter, aktiviert jedoch jeweils nur bis zu 3 Milliarden davon. Dadurch eignet es sich ideal für Aufgaben wie Software-Debugging, die Zusammenfassung von Inhalten oder die Informationssuche. Es verwendet eine hybride Mixture-of-Experts-Architektur (MoE), die Mamba-Schichten zur schnellen Verarbeitung von Sequenzen mit Transformern für präzise Schlussfolgerungen kombiniert. Diese Kombination ermöglicht einen bis zu viermal höheren Token-Durchsatz als beim vorherigen Nemotron 2 Nano und reduziert die Generierung von Schlussfolgerungs-Tokens um bis zu 60 %.

Das Modell bewältigt einen Kontext von bis zu 1 Million Tokens, was bedeutet, dass es sich enorme Informationsmengen merken kann, ohne Zusammenhänge zu verlieren. Laut der Bewertung von Artificial Analysis erreicht es unter vergleichbar großen Modellen die höchste Genauigkeit, mit einem Intelligenzindex von 52. Entwickler können es auf Grafikprozessoren des Typs DGX Spark, H100 oder B200 ausführen. Nvidia stellt fertige Anleitungen für Inferenz-Engines wie vLLM, SGLang oder TRT-LLM bereit, die eine schnelle Bereitstellung ermöglichen.

Fortschrittliche Technologien in Nemotron 3

Alle Nemotron-3-Modelle nutzen bestärkendes Lernen (RL) in mehreren Umgebungen über die offene Bibliothek NeMo Gym. Bei dieser Methode wird das Modell anhand von Aktionssequenzen in verschiedenen Umgebungen trainiert, was die Zuverlässigkeit bei mehrstufigen Aufgaben wie dem Aufrufen von Werkzeugen oder dem Schreiben von funktionsfähigem Code verbessert. NeMo Gym ist offen, sodass Entwickler eigene Umgebungen für spezifische Bereiche erstellen können.

Die hybride MoE-Architektur in Nemotron 3 verschachtelt Mamba-2- und MoE-Schichten mit mehreren Self-Attention-Schichten, wodurch die Inferenzgeschwindigkeit bei gleichbleibender Genauigkeit maximiert wird. Mamba-Schichten verarbeiten lange Abhängigkeiten mit geringem Speicherbedarf, während Transformer-Schichten logische Beziehungen bei Aufgaben wie Mathematik oder Planung verarbeiten. MoE aktiviert für jedes Token nur eine Teilmenge der Experten, was die Latenz reduziert und den Durchsatz erhöht – ideal für Systeme mit vielen Agenten.

Für lange Kontexte unterstützt das Modell 1 Million Tokens, was die Arbeit mit großen Code-Datenbanken oder Dokumenten ermöglicht, ohne sie in einzelne Teile aufteilen zu müssen. Dies verbessert die faktische Genauigkeit in Anwendungen wie Retrieval-Augmented Generation (durch Suche erweiterte Generierung) oder Compliance-Analysen.

Was die Modelle Nemotron 3 Super und Ultra bieten

Nemotron 3 Super und Ultra werden in der ersten Hälfte des Jahres 2026 erscheinen. Super verfügt über rund 100 Milliarden Parameter, von denen bis zu 10 Milliarden pro Token aktiv sind, und eignet sich für Systeme mit vielen zusammenarbeitenden Agenten. Ultra verfügt über rund 500 Milliarden Parameter, von denen bis zu 50 Milliarden aktiv sind, und ist für komplexe Aufgaben wie tiefgehende Forschung vorgesehen.

Diese Modelle führen latentes MoE ein, bei dem Experten mit einer gemeinsamen latenten Repräsentation arbeiten. Dadurch können bei gleichen Inferenzkosten viermal mehr Experten eingesetzt werden. Darüber hinaus erhöht Multi-Token Prediction (Vorhersage mehrerer Tokens) die Geschwindigkeit während des Trainings um 2,4 % und ermöglicht spekulatives Dekodieren. Das Training erfolgt in NVFP4, einem 4-Bit-Format von Nvidia, das den Speicherbedarf reduziert und den Prozess auf der Blackwell-Architektur beschleunigt, ohne die Genauigkeit zu beeinträchtigen.

Die Modelle werden mit 25 Billionen Tokens trainiert, und Nvidia veröffentlicht zur Prüfung einen synthetischen Korpus mit fast 10 Billionen Tokens. Die Datensätze umfassen 3 Billionen Tokens für das Vortraining mit einer umfassenden Abdeckung von Code und Mathematik, 13 Millionen Beispiele für das Nachtraining sowie Datensätze für RL. Der neue Nemotron Agentic Safety Dataset enthält fast 11.000 Ablaufspuren agentischer Workflows zur Sicherheitsbewertung.

Offenheit und Unterstützung für Entwickler

Nvidia veröffentlicht die Modellgewichte unter der Nvidia Open Model License zusammen mit Trainingsrezepten im Nemotron-GitHub-Repository. Dazu gehören Rezepte für das Vortraining, RL-Ausrichtung und Datenpipelines. Entwickler können die Modelle für ihre eigenen Anforderungen anpassen, etwa für domänenspezifische Aufgaben.

Nemotron 3 Nano ist auf Hugging Face, Baseten, DeepInfra, Fireworks, FriendliAI, OpenRouter und Together AI verfügbar. Es wird von Plattformen wie Couchbase, DataRobot, H2O.ai, JFrog, Lambda und UiPath unterstützt und bald auch von AWS, Google Cloud, CoreWeave, Crusoe, Microsoft Foundry, Nebius, Nscale und Yotta. Als Nvidia-NIM-Microservice gewährleistet es eine sichere Bereitstellung.

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok