Nový model GPT-6 Astra: co umí, kde selhává a kolik stojí

Nový model GPT-6 Astra: co umí, kde selhává a kolik stojí

4. 9. 2026
5 minut čtení · 3 zhlédnutí
Poslechněte si článek
Audio verze článku
Nový model GPT-6 Astra: co umí, kde selhává a kolik stojí

OpenAI představilo model GPT-6 Astra a označilo ho za nejchytřejší a nejlépe vyladěný systém, jaký kdy vydalo. Firma ho staví hlavně na třech bodech, kterými jsou ovládání počítače, odborná kancelářská práce a programování. K tomu přidává výsledky, které by ještě před rokem zněly nepravděpodobně, například stoprocentní skóre v testu tvorby útočného kódu nebo posun v matematickém problému, se kterým si lidé lámou hlavu přes osmdesát let. Model se během několika dní se dostane ke všem předplatitelům ChatGPT Plus, Pro, Business a Enterprise.

Ovládání počítače

Astra má klikat, vyplňovat a hledat místo vás. OpenAI popisuje běžné úkony jako vyplnění formuláře, zápis do firemní databáze zákazníků nebo úklid v kalendáři, ale to není vše. Model dokáže projít web, sepsat souhrn přímo do e-mailu, zpracovat vědecká data, vykreslit z nich grafy nebo otestovat hotový web, zda na něm všechno funguje.

V testu OSWorld 2.0 dosáhla Astra 72,6 procenta oproti 65,7 procenta u předchozího modelu GPT-5.6 Sol. Hlavně to zvládla přibližně o 47 procent rychleji, zhruba za 40 minut na úlohu místo 75. Spolu s vylepšeným prostředím Codexu vychází podle OpenAI dokončení úkolu až 1,9krát rychleji než dosud. Rozdíl je vidět i v testu ScreenSpot-Pro, kde Astra získala 92,7 procenta proti 76,9 procenta u Solu.

Změnil se i způsob, jakým model pracuje se zadáním. Pokud instrukce nechávají prostor pro výklad, Astra si drobnosti domyslí a zeptá se jen tam, kde odpověď mění výsledek. V Codexu se navíc umí zeptat a mezitím pokračovat v částech, které na odpovědi nezávisí. Když se uživatel neozve, model u nedůležitých rozhodnutí prostě pokračuje dál a u těch vážných počká.

Kancelářská práce a programování

OpenAI klade velký důraz na to, že Astra respektuje šablony. Prezentace, dokumenty i tabulky mají držet firemní styl a nemají se plnit balastem, protože model je trénovaný vložit do výstupu jen to, co k danému úkolu patří. V testu BenchCAD, kde systém rekonstruuje trojrozměrné objekty pomocí kódu, dosáhla Astra 95,9 procenta oproti 83,3 procenta u Solu, a to při přibližně o 43 procent nižších odhadovaných nákladech.

U programování je posun nejvýraznější. V testu Terminal-Bench 4.0. získala Astra 57,9 procenta, zatímco Sol 37,3 procenta a Claude Fable 5.1 přesně 55,8 procenta. Vývojáře však možná více potěší jiná novinka. Když se zaplní kontextové okno, modely dosud práci shrnuly do jednoho celku a přitom ztratily detaily o tom, proč něco nefungovalo. Astra si v Codexu místo toho vede poznámky napříč okny a starší část konverzace zůstává prohledatelná, takže si model může dohledat i to, co si nezapsal. Zatím jde o volitelnou funkci v konfiguraci, brzy má však být pro Astru výchozí.

Věda

Skvělé výsledky má i matematika. Astra pomohla posunout hranici u malých mezer mezi prvočísly. Přes deset let platilo, že nekonečně mnoho dvojic prvočísel je od sebe vzdáleno nanejvýš o hodnotu 246, nedávno se podařilo tuto hranici stlačit na 240 a s pomocí modelu klesla na 186. Druhý výsledek se týká neobvykle velkých mezer mezi prvočísly, kde Astra vylepšila člen v odhadu, který se nezměnil přes osmdesát let.

Ve vědeckých testech si model drží podobný trend. V testu Terminal-Bench Science 0.1 úspěšnost stoupla na 64,6 procenta oproti 22,4 procenta u Solu, GPQA Diamond ukazuje 96 procent. Astra taky umí pracovat přímo v odborném softwaru, posoudit, jak dobře se podařilo přečíst DNA, a vykreslit rozdíly mezi geny, takže výzkumník vidí, na co se má dál zaměřit.

Ne vše dopadlo skvěle. V testu Humanity's Last Exam s využitím nástrojů získala Astra 57,2 procenta, zatímco Claude Fable 5.1 dosahuje 65 procent. V souhrnném indexu Artificial Analysis vede Fable 5.1 s 65,7 bodu proti 61,2 bodu u Astry. Nový model OpenAI tedy není nejchytřejší ve všem, je spíše nejlepší v oblastech, na které ho firma cíleně trénovala.

Kyberbezpečnost

Astra jako první model OpenAI překročila v oblasti kybernetické bezpečnosti hranici, kterou si firma sama označila za kritickou. Bez ochranných opatření zvládla test ExploitBench na sto procent, zatímco Sol dosáhl 78,5 procenta. V testu ExploitGym úspěšnost stoupla na 42,4 procenta z původních 30,3 procenta, a to při výrazně menší spotřebě výstupních tokenů.

Protože se dá namítnout, že model mohl staré zranitelnosti znát z trénovacích dat, postavilo OpenAI vlastní test z chyb objevených mezi červnem a srpnem 2026. Jde o dvacet vážných zranitelností v jádru V8 napříč třinácti verzemi prohlížeče Chrome. Astra v něm uspěla ve 39 procentech případů oproti 11,5 procenta u Solu a navíc přitom sama našla a využila dvě dosud neznámé chyby. V testu SRE-Bench, který měří zpětné rozklíčování programů bez zdrojového kódu, vyřešila Astra 88 procent úloh napoprvé a 99,2 procenta na čtyři pokusy.

Verze, která se dnes spouští, proto odmítá vytvářet ukázkové útočné kódy. Obránci si s ní mohou nechat zkontrolovat a záplatovat vlastní kód, k pokročilejším úkolům je však zatím nepustí. Volnější přístup chce OpenAI otevírat postupně prostřednictvím programu Daybreak.

Lepší poslušnost

OpenAI využilo skutečný incident z minulosti týkající se platformy Hugging Face a vytvořilo z něj test. Ten zkoumá, zda model při nesplnitelném zadání překročí hranice toho, co má dovoleno. Sol bez ochranných opatření chyboval ve 48 procentech případů, Astra ani jednou. Podobně dopadl vnitřní test obcházení automatické kontroly v Codexu. V něm Astra neučinila jediný pokus o porušení pravidel, i když byla kontrola záměrně nastavená tak, aby se dala obejít, a úkol se jinak splnit nedal.

Jeden ústupek si však OpenAI přiznává. Písemné uvažování Astry se sleduje hůře než u Solu, protože model řeší jednodušší úlohy s menším počtem zapsaných kroků a má nad textem větší kontrolu. U složitých úloh se zatím uvažování skrýt nedaří. Firma přesto tento pokles bere vážně a v produkčním prostředí nasazuje pro modely třídy Astra dohled nad nevhodným chováním. Kontroly mohou legitimní práci zpomalit nebo zastavit. V ChatGPT a Codexu uživatel akci potvrdí, v rozhraní pro vývojáře se úloha ihned ukončí.

Cena a dostupnost

Astra se započítává do stávajících limitů předplatného. Uživatelé, kteří potřebují vyšší kapacitu, si mohou dokoupit kredity. Tarify Pro, Business a Enterprise navíc získají přístup k verzi GPT-6 Astra Pro. Firemní správci musí tento přístup zapnout ručně, protože ve výchozím stavu je vypnutý. Vývojáři najdou model pod označením gpt-6-astra a také na platformě Amazon Bedrock. Standardní cena činí deset dolarů za milion vstupních tokenů a padesát dolarů za milion výstupních. Rychlý režim funguje až dvakrát rychleji za dvojnásobnou cenu.

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Tvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarůTvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarů
Moonshot AI, tvůrce modelu Kimi K3, plánuje jednu z největších hongkongských emisí posledních let. Firma chce získat 3 miliardy dolarů navzdory americkým obviněním.
2 min čtení
4. 9. 2026
Model Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptuModel Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptu
Runway představuje Solaris, který mění obrazovku v živé prostředí: rozhraní vykresluje snímek po snímku a na pokyny i gesta reaguje bez klasického programování.
5 min čtení
3. 9. 2026
Nový model Atlas pomáhá trénovat roboty a točit efekty v 1440pNový model Atlas pomáhá trénovat roboty a točit efekty v 1440p
Atlas z pár fotek vytváří fotorealistické 3D světy, umožňuje přesně řídit kameru a generuje data pro trénink robotů. Podívejte se, jak si domýšlí chybějící prostor.
4 min čtení
3. 9. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok