Das Allen Institute for AI, kurz Ai2, hat gerade Olmo 3 vorgestellt, eine Familie von KI-Modellen, die sich von den meisten anderen unterscheidet. Während viele Unternehmen ihre Trainingsprozesse hüten wie ein Küchenchef das Rezept für sein bestes Gericht, teilt Ai2 alles. Olmo 3 ist nicht nur ein weiteres „offenes“ Modell, das lediglich Gewichte anbietet – Zahlen, die über die Antworten entscheiden. Hier erhalten Sie alles: die Gewichte, jeden gespeicherten Snapshot aus dem Training, Entscheidungen zu den Daten und jede Codezeile, die Rohdaten in eine denkende Maschine verwandelt hat. Es ist, als würde Tesla nicht nur das Design seiner Autos, sondern die gesamte Fabrik offenlegen.
Dieses Modell ist das erste vollständig offene Reasoning-Modell mit 32 Milliarden Parametern. Parameter sind anpassbare Werte; je mehr davon vorhanden sind, desto intelligenter sind die Antworten. Reasoning bedeutet, dass das Modell seinen Denkprozess Schritt für Schritt zeigt. Sie können jede Antwort bis zu den genauen Trainingsdaten zurückverfolgen, sie anpassen, neu aufbauen oder verbessern. Die Modellfamilie reicht von 7 Milliarden bis 32 Milliarden Parametern und läuft auf allem, von Notebooks bis hin zu Rechenzentren.
Olmo-3-Modelle und ihre Stärken
Olmo 3-Think mit 32 Milliarden Parametern ist ein Frontier-Reasoning-Modell, das seinen Denkprozess Schritt für Schritt zeigt und für Forschung und Reinforcement Learning vollständig offen ist. Es eignet sich ideal für komplexe Aufgaben, bei denen Sie nachvollziehen müssen, wie das Modell zu einer Schlussfolgerung gelangt ist. Olmo 3-Base, verfügbar mit 7 Milliarden und 32 Milliarden Parametern, überzeugt beim Programmieren, beim Leseverständnis und in Mathematik. Es verfügt über ein Kontextfenster von 65.000 Token, was etwa 50.000 Wörtern entspricht. Das bedeutet, dass es lange Texte wie ganze Bücher oder komplexe Dokumente analysieren kann.
Olmo 3-Instruct mit 7 Milliarden Parametern ist für Konversationen und den Einsatz von Werkzeugen optimiert. Es antwortet schnell, bewältigt mehrteilige Fragen und funktioniert gut in Chat-Anwendungen. Die Effizienz ist beeindruckend: Olmo 3-Think konkurriert mit ähnlich großen Modellen von Qwen, wurde jedoch mit sechsmal weniger Token trainiert. Das bedeutet geringere Kosten, weniger Energieverbrauch und schnellere Iterationen, ohne die Leistung zu beeinträchtigen.
Die Trainingskosten beliefen sich für das Modell mit 7 Milliarden Parametern auf etwa 500.000 Dollar, also ungefähr 10.485.000 Kč, und für das Modell mit 32 Milliarden Parametern auf rund 2,2 Millionen Dollar, also etwa 46.134.000 Kč. Das ist nur ein Bruchteil dessen, was für geschlossene Modelle ausgegeben wird, und alles ist kostenlos verfügbar.
Die Bedeutung des Modells Olmo 3
Lange Zeit bedeutete „Open Source“ im KI-Bereich lediglich die Freigabe der Gewichte, während die Trainingsgeheimnisse unter Verschluss blieben. Mit Olmo 3 können Forschende Ergebnisse reproduzieren, Unternehmen Modelle ohne Abhängigkeit von Anbietern anpassen und Entwickler das Verhalten des Modells verstehen. Große Technologieunternehmen möchten, dass andere von ihren undurchsichtigen Modellen abhängig sind, doch Ai2 gewährt Zugriff auf das gesamte Modell.
Die Modelle sind auf Hugging Face und im Ai2 Playground unter der Apache-2.0-Lizenz verfügbar, die eine kostenlose Nutzung, Anpassung und kommerzielle Verwendung ermöglicht. Der Code befindet sich auf GitHub und die vollständigen technischen Details sind verfügbar. Das Modell versteht Tschechisch vollständig.
Olmo 3 basiert auf Dolma 3, einem neuen Korpus mit etwa 9,3 Billionen Token aus Webseiten, wissenschaftlichen PDF-Dokumenten, Code, mathematischen Problemen und enzyklopädischen Texten. Für die mittlere Trainingsphase wurde Dolma 3 Dolmino verwendet, eine auf Mathematik, Wissenschaft, Code und Leseverständnis ausgerichtete Mischung aus 100 Milliarden Token. Für lange Kontexte wurde Dolma 3 Longmino mit 50 Milliarden Token aus langen Dokumenten hinzugefügt.
Leistung und Vergleich mit der Konkurrenz
Olmo 3-Base 32B übertrifft andere vollständig offene Basismodelle wie Marin 32B oder Apertus 70B in Mathematik, Programmierung und Leseverständnis. So erreichte es beispielsweise bei GSM8k 80,5 %, bei MATH 43,4 % und bei BigCodeBench 43,9 %. Es konkurriert auch mit Modellen wie Qwen 2.5 32B oder Gemma 3 27B.
Olmo 3-Think 32B ist das leistungsstärkste vollständig offene Reasoning-Modell und kommt Qwen 3 32B bei MATH mit 96,1 % sowie bei BigBenchHard mit 89,8 % nahe. Bei HumanEvalPlus erreichte es 91,4 %. Olmo 3-Instruct 7B übertrifft Qwen 3 8B bei der Sicherheit mit 87,3 % und ist beim Werkzeugeinsatz stark, etwa bei SimpleQA mit 79,3 %.

Das Training erfolgte auf einem Cluster mit bis zu 1.024 H100-GPUs und einem Durchsatz von 7.700 Token pro Sekunde und Gerät für das 7B-Modell. Das Post-Training wurde dank Verbesserungen wie kontinuierlichem Batching und der Aktualisierung der Gewichte während des Betriebs bei SFT um das Achtfache und bei RL um das Vierfache beschleunigt.
Olmo 3 integriert OlmoTrace, ein Werkzeug, mit dem sich Ausgaben in Echtzeit zu den Trainingsdaten zurückverfolgen lassen. Dadurch kann nachvollzogen werden, warum das Modell auf eine bestimmte Weise antwortet, und die Daten können bei Bedarf angepasst werden.
Für das Post-Training wurde Dolci vorgestellt, ein Datensatz für Reasoning, den Einsatz von Werkzeugen und Anweisungen. Er enthält Mischungen für SFT, DPO und RLVR. Olmo 3-RL Zero 7B bietet einen Weg für Reinforcement Learning direkt auf dem Basismodell, mit Checkpoints für Mathematik, Code, Anweisungen und Chat.
Die Modelle laufen bei der 32B-Version auf einer einzelnen GPU mit 80 GB Speicher, was ideal für die Forschung ist. Ai2 plant weitere Verbesserungen wie Mixture-of-Experts-Ansätze oder ein besseres Zeichentraining, doch Olmo 3 setzt bereits jetzt Maßstäbe für Offenheit.
Hier können Sie sich mit dem Modell unterhalten: playground.allenai.org
Weitere Quelle: interconnects.ai



