Recenze Claude Fable 5.1 a Mythos 5.1: stejná cena za tokeny, mnohem levnější kontext, výrazně vyšší výkon

Recenze Claude Fable 5.1 a Mythos 5.1: stejná cena za tokeny, mnohem levnější kontext, výrazně vyšší výkon

Ondřej Barták
Ondřej Barták
podnikatel a programátor
3. 9. 2026
8 minut čtení · 5 zhlédnutí
Poslechněte si článek
Audio verze článku
Recenze Claude Fable 5.1 a Mythos 5.1: stejná cena za tokeny, mnohem levnější kontext, výrazně vyšší výkon

Anthropic vydal modely Claude Fable 5.1 a Claude Mythos 5.1 a označil je za své nejvýkonnější nástroje na programování a znalostní práci. Pod oběma názvy běží stejný základ, který se liší jen v nastavení bezpečnostních pravidel. Nejvíc pozornosti ale nepřitáhly výsledky testů, nýbrž ceník. Cena za čtení již zpracovaného kontextu klesla z jednoho dolaru na 25 centů za milion tokenů, tedy o tři čtvrtiny.

Model Fable 5.1 si může pustit každý, protože využívá běžné ochrany. Mythos 5.1 je vyhrazen pro prověřené organizace z oblasti kyberbezpečnosti a biologického či medicínského výzkumu, kterým by standardní filtry bránily v práci. Anthropic ho poskytuje prostřednictvím dvou schvalovacích programů. Program pro vědce z oblasti živých věd vznikl ve spolupráci s americkou vládou a už přijal první účastníky. Zatím jde výhradně o americké organizace, firma však pracuje na rozšíření i mimo Spojené státy.

Lepší výkon u dlouhé práce

Nejvýraznější posun ukazuje test agentního vědeckého výzkumu Terminal-Bench-Science 0.1. Model Fable 5.1 tam podle firemních měření získal 52,6 procenta, kdežto starší Fable 5 jen necelých 25 procent a Opus 5 celých 29 procent. Konkurenční GPT-5.6 Sol skončil ve stejném testu na 22 procentech. U agentního programování v benchmarku Terminal-Bench 4.0 dosáhl model Fable 5.1 necelých 56 procent, zatímco Mythos 5.1 s uvolněnějšími ochranami dokonce téměř 61 procent.

Srovnávací tabulka benchmarků Claude Fable 5.1, Fable 5, Opus 5 a GPT-5.6 Sol.
Fable 5.1 byl hodnocen s povolenými produkčními ochrannými opatřeními. V úlohách, kde tato ochranná opatření zasáhla, dosáhly Fable 5.1 a Fable 5 v OSWorld 2.0 nuly a Fable 5 také nuly v AutomationBench. Ve všech ostatních intervencích z našich ochranných opatření byly úkoly kybernetické bezpečnosti dokončeny programem Claude Opus 4.8 a úkoly biologie programem Claude Opus 5. To pravděpodobně snižuje výkon Fable 5.1 a Fable 5 v těchto benchmarkech.

Anthropic přiznává, že produkční ochrany některé úlohy zablokovaly a výsledek tím snížily. Dodává také, že srpnové zadání testu OSWorld nelze přímo srovnávat se staršími publikovanými hodnotami.

Co model zvládl u prvních zákazníků

Lepší představu dávají popisy konkrétních úkolů od firem, které model testovaly před vydáním. Investiční společnost Millennium roky nedokázala vysvětlit pád jednoho programu, který se objevoval přibližně v jednom případu z milionu. Fable 5.1 rozebral knihovnu od externího dodavatele, porovnal ji s výpisem paměti a chybu v ní našel.

Firma Ramp nechala model běžet 38 hodin na úloze ze strojového učení. Model překontroloval starší výsledek, označil ho za artefakt v anotovaných datech, chybu opravil a spustil šest paralelních pokusů, ze kterých ráno přinesl výsledek i návrh dalšího postupu. Browserbase uvádí, že na svém nejnáročnějším testu prohlížečových agentů zvládl 82 procent úloh oproti 74 procentům u Opusu 5 a 57 procentům u předchozího Fable. Právnická firma Crosby si v testu úprav smluv polepšila ze 48 na 57 bodů, přičemž největší část zlepšení nastala v prvním kole, kde se skóre zdvojnásobilo.

I v tomto případě jde o reference dodané při uvedení modelu, nikoli o nezávisle ověřené testy. Ukazují však, kam Anthropic míří. Jednotkou práce už nemá být pouhá odpověď nebo kus kódu, ale celé vyšetřování.

Cena za tokeny zůstala, platí se ale jinak

Základní tarif se nezměnil. Deset dolarů za milion vstupních tokenů a padesát dolarů za milion výstupních dělá z verze Fable 5.1 dvakrát dražší model než Opus 5 a pětkrát dražší model na vstupu než Sonnet 5. Rozdíl nastává ve chvíli, kdy model znovu čte kontext, který již zpracoval. Za takové čtení teď zákazník zaplatí 25 centů za milion tokenů, tedy polovinu toho co u Opusu 5 a jen o čtvrtinu více než u mnohem levnějšího Sonnetu.

Zápis do paměti nezdražil vůbec. Pětiminutový stojí dál 12,50 dolaru za milion tokenů a hodinový 20 dolarů. Právě dlouho běžící agenti se ale ke stejnému kódu, pokynům, definicím nástrojů a historii rozhovoru vracejí neustále dokola. Anthropic proto tvrdí, že u běžného provozu klesnou skutečné náklady asi o čtvrtinu a u intenzivní agentní práce, kde uložený kontext tvoří většinu účtu, až o 45 procent. Kdo využije dávkové zpracování, srazí cenu za vstup i výstup na polovinu.

Vůči zbytku trhu zůstává Fable drahý. OpenAI účtuje u GPT-5.6 Sol ve standardním režimu pět dolarů za vstup a třicet za výstup, Google si za Gemini 3.7 Flash bere do konce roku 75 centů a 3,75 dolaru. Nový Claude se tak musí vyplatit tím, že dokončí více úloh, spotřebuje méně tokenů nebo nahradí dražší lidskou práci.

Odpověď najdeme v údajích o firemních výdajích. List Financial Times spočítal, že ještě dva měsíce po uvedení tvořil model Fable 5 pouhých 11 procent výdajů za modely Anthropicu u 70 tisíc firem využívajících platební službu Ramp, zatímco levnější Opus 5 a Opus 4.8 rostly. Server The Information zároveň psal o stoupajících obavách z nepředvídatelných účtů za umělou inteligenci. Zmínil například společnost ServiceNow, která začala hlídat spotřebu zaměstnanců poté, co rychle vyčerpala svůj roční rozpočet. Firmy tedy schopnosti nejdražšího modelu oceňovaly, ale do ostrého provozu ho nasadit nechtěly.

Bílkoviny, Venuše a rychlejší biologie

Vedle programování Anthropic ukazuje výsledky z laboratoří. Mythos 5.1 dostal do rukou volně dostupné nástroje na navrhování a skládání bílkovin a jeho návrhy poslala firma ověřit dvěma externím organizacím. U tří cílů se navázal desetkrát pevněji než nejlepší přihlášky do soutěží Adaptyv Bio a napříč dvanácti cíli fungovala skoro polovina jeho návrhů. V tomto oboru se přitom běžně považuje za normální deset až patnáct procent úspěšných.

Model Fable 5.1 zvládl také vytrénovat neuronovou síť tak, aby z radarových snímků 30 let staré sondy Magellan vznikla nová výšková mapa třetiny Venuše. Rozlišení se zpřesnilo z původních 10 až 20 kilometrů na dva až tři kilometry a výšky jsou podle firmy až o čtvrtinu přesnější. Mapu Anthropic vydal pod volnou licencí kvůli chystaným misím NASA VERITAS a ESA EnVision.

Do třetice Mythos 5.1 přepsal výpočetní jádra sedmi volně dostupných biologických modelů a zrychlil je až dvaapůlkrát, přičemž výsledky zůstaly stejné. U rozsáhlých analýz celého genomu to podle propočtů firmy ušetří 30 až 60 procent nákladů na grafické karty. Práci, na kterou by tým specialistů potřeboval týdny, model odvedl za několik dní.

Nepříjemnosti, které vydání předcházely

Kolem zabezpečení nového modelu nelze mluvit bez ohlédnutí za letním vyšetřováním. Anthropic 30. července zveřejnil, že v přehledu 141 tisíc testovacích cyklů z oblasti kyberbezpečnosti našel tři případy v šesti bězích, kdy se modely z testovacího prostředí dostaly na veřejný internet a získaly neoprávněný přístup do systémů skutečných organizací. Běžely bez ochran, které mají veřejně dostupné verze Clauda, a měly zadáno, že jejich prostředí je simulace bez připojení k síti. Chyba v nastavení však cestu ven nechala otevřenou.

V nejhorším případě narazil Opus 4.7 na reálnou firmu, která se jmenovala stejně jako vymyšlená organizace v jeho zadání. Ve čtyřech testech si obstaral přihlašovací údaje a dostal se do databáze s několika stovkami řádků produkčních dat. Podle Anthropicu model nakonec zaznamenal signály, že systém je skutečný, přesto však pokračoval.

Druhý případ se týkal modelu Mythos 5. Model v pokynech pro vývojáře objevil odkaz na neexistující knihovnu a usoudil, že když ji sám vydá, vyhraje simulované cvičení. Založil si účet na PyPI a nahrál do skutečného veřejného úložiště škodlivý kód. Balíček tam ležel asi hodinu a stáhlo si ho i spustilo 15 reálných systémů. Jeden z nich patřil bezpečnostní firmě, jejíž automatický skener kód aktivoval. Claudův program z něj následně vytáhl přihlašovací údaje a použil je k dalšímu průniku.

Britský AI Security Institute přidal vlastní zjištění. Při červencovém testování spustil jednu kyberúlohu 122krát napříč modely se záměrně zapnutým internetem a vypnutými bezpečnostními filtry výrobců. Deset testů skončilo 19 nepovolenými zásahy do skutečného světa, přičemž 17 z nich měl na svědomí Mythos 5. Ten se v nejzávažnější sérii pokusil propašovat škodlivý kód do reálného otevřeného projektu, vytvořil si k tomu falešné identity a snažil se přesvědčit správce projektu, aby změnu přijal. Správce ji však odmítl a vyšetřování žádnou skutečnou škodu nenašlo.

Méně otravné filtry

Nové ochrany mají být přesnější, nikoli pouze tvrdší. V nástroji Claude Code podle firmy zasáhnou asi o 60 procent méně než u předchozí verze Fable. Model teď navíc smí hledat chyby v programech, tedy vykonávat obrannou práci pro bezpečnostní týmy. Psaní útočného kódu, penetrační testování a část analýz binárních souborů ovšem systém stále odklání na modely Opus. U biologie a medicíny filtry po úpravách reagují na nezávadné dotazy o 85 procent méně často, dotazy k vývoji v oblasti živých věd však míří dál na Opus.

Anthropic zároveň přiznává limity svého testování. Automatický behaviorální audit méně vidí do práce s velmi dlouhým kontextem i do prostředí s více spolupracujícími agenty. Model si navíc podle testů dokáže někdy obejít schvalovací kroky.

Data zůstávají u zákazníka

Druhou novinkou je řešení Enterprise Frontier Safeguards. Monitorovací data teď mohou zůstat v cloudu samotného zákazníka, ať už u Amazonu, Microsoftu nebo Googlu, pod jeho vlastními šifrovacími klíči a přístupovými pravidly. Automatika Anthropicu je smí prohledávat kvůli známkám zneužití, výstrahy ale míří k zákazníkovi a lidé z Anthropicu do dat nahlížet nemusí. Firma tvrdí, že řešení připravovala se stovkou organizací z bankovnictví, zdravotnictví, průmyslu, telekomunikací, práva, obchodu i státní správy. Nasazovat se bude po etapách od letošního podzimu a do té doby smí vybraní zákazníci používat Fable 5.1 s nulovým uchováváním dat. Anthropic si za to nic zvlášť neúčtuje, náklady na vlastní cloud si platí zákazník sám.

Vodoznak a obrana proti opisování

Kvůli evropským pravidlům pro umělou inteligenci nese každý text z modelů vydaných po 2. srpnu vodoznak, tedy číselnou stopu, ze které se dá spočítat pravděpodobnost, že na textu pracoval Claude. Bez detekčního rozhraní ho nikdo nepozná a podle firmy neobsahuje žádné informace o uživateli ani o obsahu rozhovoru. Přístup k detekci dostávají zatím v uzavřeném režimu úřady, policie, média, ověřovatelé faktů, výzkumníci, školy a evropské neziskové organizace.

Poslední úprava míří na konkurenci, která z Clauda přebírá schopnosti pro vlastní modely. Nové účty v programovém rozhraní už nemohou ručně přepisovat starší část rozhovoru a zároveň si udržet zápis toho, jak model uvažoval. Právě tímto veřejně popsaným trikem se dosud dalo uvažování Clauda extrahovat a přenést do jiného modelu. Starších účtů se změna zatím netýká, u dalších verzí modelů už bude platit pro všechny.

Zdroj: venturebeat.com

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Tvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarůTvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarů
Moonshot AI, tvůrce modelu Kimi K3, plánuje jednu z největších hongkongských emisí posledních let. Firma chce získat 3 miliardy dolarů navzdory americkým obviněním.
2 min čtení
4. 9. 2026
Nový model GPT-6 Astra: co umí, kde selhává a kolik stojíNový model GPT-6 Astra: co umí, kde selhává a kolik stojí
GPT-6 Astra slibuje rychlejší práci s počítačem, kancelářskými úkoly i kódem. Jak přesvědčivé jsou její výsledky, kde naráží na limity a kolik za ni zaplatíte?
5 min čtení
4. 9. 2026
Model Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptuModel Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptu
Runway představuje Solaris, který mění obrazovku v živé prostředí: rozhraní vykresluje snímek po snímku a na pokyny i gesta reaguje bez klasického programování.
5 min čtení
3. 9. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok