Gemini 4 Argon soll laut Google bis zu eine Million Ausgabe-Token erzeugen

Gemini 4 Argon soll laut Google bis zu eine Million Ausgabe-Token erzeugen

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
3. 10. 2026
3 Minuten Lesezeit · 15 Aufrufe
Artikel anhören
Audioversion des Artikels
Gemini 4 Argon soll laut Google bis zu eine Million Ausgabe-Token erzeugen

Google hat sein neues Flaggschiffmodell Gemini 4 Argon vorgestellt. Nach Unternehmensangaben unterstützt es durchgehende Denk- und Generierungssequenzen mit bis zu einer Million Ausgabe-Token, gegenüber 64 000 in der vorherigen Generation. Zugleich belegt das Modell laut Vals den ersten Platz im Vals Index für Aufgaben, die beruflichen Arbeitsabläufen nahekommen; Zugang erhalten zunächst vertrauenswürdige Partner aus der Cybersicherheit.

Längere Ausgaben und die Testkonfiguration

Google beschreibt das Ausgabelimit von einer Million Token als Möglichkeit, Denk- und Generierungssequenzen ohne Unterbrechung fortzusetzen. Dieses Limit ist vom Kontextfenster zu unterscheiden: In der Testkonfiguration von Vals umfasste Argons Kontext eine Million Token, während die Ausgabe auf 262 000 Token begrenzt war.

Für diese Bewertung mit einem niedrigeren Ausgabelimit als von Google angegeben testete Vals das Modell über Googles Anbieter mit einer Temperatur von 1 und den Standardwerten für top-p und top-k. Der für das Schlussfolgern vorgesehene Aufwand, das sogenannte Reasoning Effort, war auf eine hohe Stufe eingestellt.

Spitzenplatz im Vals Index bei geringerem Tokenverbrauch

In der Bewertung von Vals erreichte Argon 68,9 % und verschaffte Google damit erstmals die alleinige Führung in diesem Index. Die Aufgaben decken Finanzen und Recht sowie Softwareentwicklung und Steuern ab. Sie sind so gestaltet, dass sie sich den Arbeitsabläufen dieser Berufsfelder annähern.

Neben dem Gesamtergebnis ermittelte Vals einen geringeren Tokenverbrauch. Bei vergleichbarer Arbeit an den Index-Aufgaben benötigte Argon ungefähr ein Viertel der Ausgabe-Token von Claude Sonnet 5.5. Bei den Eingabe-Token lag der Verbrauch bei etwa einem Drittel.

Im Steuertest Tax Agent zeigte sich auch ein Unterschied bei der Zahl der Interaktionsschritte. Laut Vals benötigte Argon im Durchschnitt 19 Schritte gegenüber 47 bei Sonnet 5.5, obwohl seine Antworten mehr als doppelt so lang waren.

Finanzen und Recht: weniger Fehler, mehr abgeschlossene Aufgaben

In Finance Agent v2 belegte Argon laut Vals mit 65,4 % den ersten Platz. Zu den starken Ergebnissen gehörte die Arbeit mit Ergebnisberichten und veröffentlichten Finanzinformationen. Im selben Test verursachte das Modell beim Einsatz von Werkzeugen ungefähr ein Fünftel so viele Fehler wie Sonnet 5.5.

In der juristischen Bewertung Harvey Legal Agent verzeichnete Vals bei Argon ungefähr siebenmal so viele vollständig abgeschlossene Aufgaben wie bei Sonnet 5.5. Dabei erfüllte Argon nahezu alle Bewertungskriterien in 24 Bereichen der Rechtspraxis.

Programmierung: Vorsprung bei Apps, aber nicht in jedem Test

In Vibe Code Bench v1.1 erzielte Argon nach den Ergebnissen von Vals bei 30 Anwendungen die volle Punktzahl. Claude Opus 5 gelang dies bei 25 Anwendungen, GPT-6 Astra bei 24. Zugleich registrierte Vals bei Argon ungefähr ein Drittel weniger Werkzeugaufrufe.

Auf Terminal-Bench 4.0 ermittelte Vals für Argon 57,6 %, während Gemini 3.8 Flash 19,0 % erreichte. Argon erledigte die Aufgaben zudem in der Hälfte der Gesamtzeit. Den ersten Platz in diesem Test hielt allerdings Claude Opus 5.5 mit 66,4 %.

Beim Wettbewerbsprogrammieren zog Argon laut Vals mit GPT-6 Astra gleich. Auf jedem der Aufgabensätze IOI 2024, 2025 und 2026 erreichte es 100 %.

Cybersicherheit und schwächere Disziplinen

In CyberBench belegte Argon laut Vals bei Proof-of-Concept-Aufgaben zur Ausnutzung binärer Programme mit 70,0 % den ersten Platz. In der Gesamtwertung dieses Benchmarks wurde es Zweiter hinter GPT-6 Sol und lag 18 Punkte vor Sonnet 5.5.

Deutlich schwächer fiel die Platzierung bei der Bedienung grafischer Oberflächen aus. Auf CUA-bench erreichte Argon laut Vals 4,83 % und wurde Siebter von acht Modellen. In MedScribe erzielte es 87,4 %, belegte damit aber nur den 15. Platz.

Auch die formale Generierung von Code aus Spezifikationen gehörte zu den schwächeren Disziplinen. In ProgramBench ermittelte Vals für Argon 2,5 %.

Zunächst Zugang für Partner, Gemini API soll folgen

Google beginnt, Argon schrittweise für vertrauenswürdige Partner aus der Cybersicherheit freizugeben, und bewertet gleichzeitig mit der US-Regierung die Sicherheit des Modells. Ein breiterer Zugang über die Gemini API wird später erwartet; ein Startdatum wurde noch nicht angekündigt.

Die Standardtarife betragen 4 US-Dollar je Million Eingabe-Token und 20 US-Dollar je Million Ausgabe-Token; die von Googles Logan Kilpatrick angekündigten Einführungstarife liegen bei 2 US-Dollar je Million Eingabe-Token und 10 US-Dollar je Million Ausgabe-Token.

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Qwen-Image-2.1 erzeugt und bearbeitet Bilder mit transparentem HintergrundQwen-Image-2.1 erzeugt und bearbeitet Bilder mit transparentem Hintergrund
Alibaba hat einen gemeinsamen Checkpoint für Bilderzeugung und Bearbeitung veröffentlicht. Qwen-Image-2.1 unterstützt transparente PNGs und akzeptiert laut dem Unternehmen bis zu 10 Referenzbilder. Für kommerzielle Einsätze ist eine separate Lizenz nötig.
3 Min. Lesezeit
3. 10. 2026
OpenAI meldet Stopp einer Kampagne zum Auslesen interner DenkprozesseOpenAI meldet Stopp einer Kampagne zum Auslesen interner Denkprozesse
Laut OpenAI manipulierten Angreifer Gespräche, um geschützte interne Denkprozesse zu extrahieren. Das Unternehmen beschreibt eine Kampagne im Juli, schreibt einen Teil der Aktivitäten Personen mit Verbindungen zu Moonshot AI zu und hat den Schutz von Modellen und Konten verstärkt.
3 Min. Lesezeit
3. 10. 2026
Meta gründet Enterprise Platform für den KI-Einsatz in UnternehmenMeta gründet Enterprise Platform für den KI-Einsatz in Unternehmen
Die neue Initiative soll Metas KI-Technologien in Produkte und Dienste für Unternehmen überführen. Zunächst stehen Muse, Meta Business Agent, Muse API und Muse Code im Fokus. Die Leitung übernimmt CJ Desai, der von MongoDB kommt.
1 Min. Lesezeit
3. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok