Google hat sein neues Flaggschiffmodell Gemini 4 Argon vorgestellt. Nach Unternehmensangaben unterstützt es durchgehende Denk- und Generierungssequenzen mit bis zu einer Million Ausgabe-Token, gegenüber 64 000 in der vorherigen Generation. Zugleich belegt das Modell laut Vals den ersten Platz im Vals Index für Aufgaben, die beruflichen Arbeitsabläufen nahekommen; Zugang erhalten zunächst vertrauenswürdige Partner aus der Cybersicherheit.
Längere Ausgaben und die Testkonfiguration
Google beschreibt das Ausgabelimit von einer Million Token als Möglichkeit, Denk- und Generierungssequenzen ohne Unterbrechung fortzusetzen. Dieses Limit ist vom Kontextfenster zu unterscheiden: In der Testkonfiguration von Vals umfasste Argons Kontext eine Million Token, während die Ausgabe auf 262 000 Token begrenzt war.
Für diese Bewertung mit einem niedrigeren Ausgabelimit als von Google angegeben testete Vals das Modell über Googles Anbieter mit einer Temperatur von 1 und den Standardwerten für top-p und top-k. Der für das Schlussfolgern vorgesehene Aufwand, das sogenannte Reasoning Effort, war auf eine hohe Stufe eingestellt.
Spitzenplatz im Vals Index bei geringerem Tokenverbrauch
In der Bewertung von Vals erreichte Argon 68,9 % und verschaffte Google damit erstmals die alleinige Führung in diesem Index. Die Aufgaben decken Finanzen und Recht sowie Softwareentwicklung und Steuern ab. Sie sind so gestaltet, dass sie sich den Arbeitsabläufen dieser Berufsfelder annähern.
Neben dem Gesamtergebnis ermittelte Vals einen geringeren Tokenverbrauch. Bei vergleichbarer Arbeit an den Index-Aufgaben benötigte Argon ungefähr ein Viertel der Ausgabe-Token von Claude Sonnet 5.5. Bei den Eingabe-Token lag der Verbrauch bei etwa einem Drittel.
Im Steuertest Tax Agent zeigte sich auch ein Unterschied bei der Zahl der Interaktionsschritte. Laut Vals benötigte Argon im Durchschnitt 19 Schritte gegenüber 47 bei Sonnet 5.5, obwohl seine Antworten mehr als doppelt so lang waren.
Finanzen und Recht: weniger Fehler, mehr abgeschlossene Aufgaben
In Finance Agent v2 belegte Argon laut Vals mit 65,4 % den ersten Platz. Zu den starken Ergebnissen gehörte die Arbeit mit Ergebnisberichten und veröffentlichten Finanzinformationen. Im selben Test verursachte das Modell beim Einsatz von Werkzeugen ungefähr ein Fünftel so viele Fehler wie Sonnet 5.5.
In der juristischen Bewertung Harvey Legal Agent verzeichnete Vals bei Argon ungefähr siebenmal so viele vollständig abgeschlossene Aufgaben wie bei Sonnet 5.5. Dabei erfüllte Argon nahezu alle Bewertungskriterien in 24 Bereichen der Rechtspraxis.
Programmierung: Vorsprung bei Apps, aber nicht in jedem Test
In Vibe Code Bench v1.1 erzielte Argon nach den Ergebnissen von Vals bei 30 Anwendungen die volle Punktzahl. Claude Opus 5 gelang dies bei 25 Anwendungen, GPT-6 Astra bei 24. Zugleich registrierte Vals bei Argon ungefähr ein Drittel weniger Werkzeugaufrufe.
Auf Terminal-Bench 4.0 ermittelte Vals für Argon 57,6 %, während Gemini 3.8 Flash 19,0 % erreichte. Argon erledigte die Aufgaben zudem in der Hälfte der Gesamtzeit. Den ersten Platz in diesem Test hielt allerdings Claude Opus 5.5 mit 66,4 %.
Beim Wettbewerbsprogrammieren zog Argon laut Vals mit GPT-6 Astra gleich. Auf jedem der Aufgabensätze IOI 2024, 2025 und 2026 erreichte es 100 %.
Cybersicherheit und schwächere Disziplinen
In CyberBench belegte Argon laut Vals bei Proof-of-Concept-Aufgaben zur Ausnutzung binärer Programme mit 70,0 % den ersten Platz. In der Gesamtwertung dieses Benchmarks wurde es Zweiter hinter GPT-6 Sol und lag 18 Punkte vor Sonnet 5.5.
Deutlich schwächer fiel die Platzierung bei der Bedienung grafischer Oberflächen aus. Auf CUA-bench erreichte Argon laut Vals 4,83 % und wurde Siebter von acht Modellen. In MedScribe erzielte es 87,4 %, belegte damit aber nur den 15. Platz.
Auch die formale Generierung von Code aus Spezifikationen gehörte zu den schwächeren Disziplinen. In ProgramBench ermittelte Vals für Argon 2,5 %.
Zunächst Zugang für Partner, Gemini API soll folgen
Google beginnt, Argon schrittweise für vertrauenswürdige Partner aus der Cybersicherheit freizugeben, und bewertet gleichzeitig mit der US-Regierung die Sicherheit des Modells. Ein breiterer Zugang über die Gemini API wird später erwartet; ein Startdatum wurde noch nicht angekündigt.
Die Standardtarife betragen 4 US-Dollar je Million Eingabe-Token und 20 US-Dollar je Million Ausgabe-Token; die von Googles Logan Kilpatrick angekündigten Einführungstarife liegen bei 2 US-Dollar je Million Eingabe-Token und 10 US-Dollar je Million Ausgabe-Token.



