Google představil nový vlajkový model Gemini 4 Argon. Podle firmy podporuje souvislé sekvence uvažování a generování až do jednoho milionu výstupních tokenů, zatímco předchozí generace dosahovala 64 000. Model zároveň získal první místo ve Vals Indexu, který hodnotí úlohy blízké profesním pracovním postupům; zpřístupňování začíná u důvěryhodných partnerů v kyberbezpečnosti.
Delší generování a podmínky hodnocení
Google popisuje milionový výstupní limit jako možnost pokračovat v souvislém uvažování a generování. Jde o jiný parametr než velikost kontextového okna: v testovací konfiguraci Vals měl Argon kontext o jednom milionu tokenů, ale výstup byl omezen na 262 000 tokenů.
Vals model testoval přes poskytovatele Googlu s teplotou nastavenou na 1 a s výchozími hodnotami top-p a top-k. Úsilí věnované uvažování bylo nastaveno na vysokou úroveň. Výsledky hodnocení tak vycházejí z konfigurace s nižším výstupním stropem, než jaký Google pro Argon uvádí.
Prvenství ve Vals Indexu a nižší spotřeba tokenů
V hodnocení Vals dosáhl Argon skóre 68,9 % a přinesl Googlu první samostatné prvenství v tomto indexu. Testované úlohy se týkají financí a práva, ale také vývoje softwaru a daní. Jsou navržené tak, aby se přibližovaly pracovním postupům používaným v těchto profesích.
Vedle výsledného skóre Vals zaznamenal nižší spotřebu tokenů. Při srovnatelné práci na úlohách indexu využil Argon přibližně čtvrtinu výstupních tokenů modelu Claude Sonnet 5.5. U vstupních tokenů byla jeho spotřeba přibližně třetinová.
V daňovém testu Tax Agent se rozdíl projevil také v počtu tahů. Podle Vals potřeboval Argon průměrně 19 tahů oproti 47 u Sonnetu 5.5, přestože jeho odpovědi byly více než dvakrát delší.
Finance a právo: méně chyb, více dokončených úloh
Ve Finance Agent v2 obsadil Argon podle Vals první místo se skóre 65,4 %. Silné výsledky zahrnovaly práci s výkazy hospodaření a zveřejňovanými finančními informacemi. Ve stejném testu vykázal přibližně pětinu chyb při použití nástrojů oproti Sonnetu 5.5.
V právním hodnocení Harvey Legal Agent Vals zaznamenal přibližně sedmkrát více zcela dokončených úloh než u Sonnetu 5.5. Argon přitom splnil téměř všechna hodnoticí kritéria napříč 24 oblastmi právní praxe.
Programování: náskok v aplikacích, ne v každém testu
Ve Vibe Code Bench v1.1 získal Argon podle výsledků Vals plný výsledek u 30 aplikací. Claude Opus 5 jej dosáhl u 25 aplikací a GPT-6 Astra u 24. Vals u Argonu zároveň zaznamenal přibližně o třetinu méně volání nástrojů.
Na Terminal-Bench 4.0 naměřil Vals Argonu 57,6 %, zatímco Gemini 3.8 Flash dosáhl 19,0 %. Argon navíc úlohy dokončil za polovinu celkového času. Prvenství v tomto testu však držel Claude Opus 5.5 se skóre 66,4 %.
V soutěžním programování se Argon podle Vals vyrovnal GPT-6 Astra. Na každé ze sad IOI 2024, 2025 a 2026 dosáhl skóre 100 %.
Kyberbezpečnost a slabší disciplíny
V CyberBench byl Argon podle Vals první v úlohách zaměřených na proof-of-concept zneužití binárních programů, kde získal 70,0 %. V celkovém hodnocení tohoto benchmarku skončil druhý za GPT-6 Sol a o 18 bodů před Sonnetem 5.5.
Podstatně slabší umístění Vals zaznamenal při ovládání grafických rozhraní. Na CUA-bench získal Argon 4,83 % a skončil sedmý z osmi modelů. V MedScribe dosáhl 87,4 %, ale v pořadí obsadil až 15. místo.
Slabý výsledek se týkal také formálního generování kódu ze specifikací. V ProgramBench naměřil Vals Argonu skóre 2,5 %.
Přístup začíná u partnerů, Gemini API má následovat
Google zahajuje postupné zpřístupňování Argonu důvěryhodným partnerům v kyberbezpečnosti a současně s americkou vládou vyhodnocuje jeho bezpečnost. Širší dostupnost přes Gemini API se očekává později; datum jejího zahájení zatím oznámeno nebylo.
Standardní sazby činí 4 dolary za milion vstupních tokenů a 20 dolarů za milion výstupních tokenů, zatímco zaváděcí sazby oznámené Loganem Kilpatrickem z Googlu jsou 2 dolary za milion vstupních a 10 dolarů za milion výstupních tokenů.



