Anthropic nechal Claude opravovat sám sebe. Výsledky docela překvapí

Anthropic nechal Claude opravovat sám sebe. Výsledky docela překvapí

Ondřej Barták
Ondřej Barták
podnikatel a programátor
31. 8. 2026
5 minut čtení · 2 zhlédnutí
Poslechněte si článek
Audio verze článku
Anthropic nechal  Claude opravovat sám sebe. Výsledky docela překvapí

Anthropic nechal model Claude bez lidského dozoru trénovat jiné modely, aby přestaly dělat deset konkrétních druhů chyb. Agenti si sami pročetli literaturu, navrhli metodu, připravili trénovací data, model natrénovali a poslali jej na vyhodnocení. U všech deseti druhů selhání našli postup, který výsledky zlepšil, aniž by snížil obecné schopnosti modelu. Zpráva však přiznává, že ve 39 z 1601 zaznamenaných případů se agenti pokusili test obejít.

Jak celý postup vypadal

Za názvem automatizovaný výzkumník stojí pečlivě postavená sestava agentů, nikoli jeden vynalézavý dotaz. Pro každé cílové selhání nejdříve čtyři vyhledávací agenti sestavili přehled existující literatury. Potom se spustilo pět výzkumných agentů současně a pracovali až 48 hodin. Každé kolo začínalo v nové relaci, takže si agent sám od sebe nic nepamatoval. Přenášel si pouze soubor s pamětí, kde měl zapsané dosavadní metody a jejich skóre.

Agent si přečetl rešerši i tabulku výsledků, prohledal web, navrhl metodu a napsal krátký odborný text bez výsledků. Kód poslal ke schválení, dostal přibližně půl hodiny na jedné grafické kartě H200, model natrénoval a hotové váhy odeslal samostatnému hodnotiteli. Agenti se navzájem viděli ve společném vlákně, takže mohli navázat na cizí slibný výsledek. Když výzkumníci vyhledávací nebo společné vlákno odebrali, výsledek klesl více, než když agentům vzali živý přístup k internetu.

Agenti si nesměli odpověď odvodit sami ze sebe ani ze silnějšího modelu a trénovací data museli vyrobit z veřejných zdrojů, šablon nebo z výstupů samotného cílového modelu. Před tréninkem kontrolní model porovnal zamčený popis metody se skutečným kódem a zamítl použití testovacích dat i skrytou pomoc většího modelu.

Deset selhání, která se dají změřit

Seznam cílů zahrnoval patolízalství, ochotu obejít vlastní pravidla, zranitelnost vůči vloženým příkazům, snahu získávat vliv, klamání, nepodložená tvrzení, společenské předsudky, porušování soukromí, obcházení odměny při tréninku a zamlčování nejistoty. Jako cvičné posloužily malé volně dostupné modely o velikosti dvou až sedmi miliard parametrů, konkrétně Qwen3.5-2B, Phi-4-mini, Llama-3.2-3B, Gemma-2-2B nebo Olmo-3-7B.

Pro každé selhání dostal agent tři až pět veřejných testů, u soukromí například ConfAIde, PrivaCI-Bench a PrivacyLens. Vedle nich existovala oddělená sada, ze které agenti neviděli ani jeden příklad. Hodnotitel navíc kontroloval obecné dovednosti na testech MMLU, GSM8K a IFEval, přičemž při významném propadu byla metoda vyřazena.

Úspěch se počítal jako podíl uzavřené bezpečnostní mezery, což vyjadřovalo, jak daleko se model posunul od svého původního stavu k teoreticky dokonalému výsledku. Nejlepší metody uzavřely mezi 26 a 96 procenty. U klamání činil průměr 85 procent, přičemž v jednom běhu odeslal agent více než 150 pokusů a skončil na 82 procentech. Dosáhnout 85 procent ovšem neznamená, že model přestal klamat v 85 procentech reálných situací. Znamená to pouze, že překonal 85 procent vzdálenosti k maximu vybraných testů.

Co obstálo, když se přestalo optimalizovat

Systém, který smí vyzkoušet sto padesát metod, se na hlučné tabulce vyšplhá nahoru i náhodou. Anthropic proto přidal tři kontroly. Nejlepší metoda musela porazit původní model na skryté sadě, kterou agenti neviděli. Vybrané postupy pak fungovaly i na modelech nejméně 1,8krát a maximálně 4,7krát větších, než na jakých se provádělo vyhledávání. Veškeré výsledky navíc prošly nástrojem Petri, který samostatně generuje nepřátelské rozhovory na několik tahů a v němž se cílené chování objevovalo méně často.

Vylepšování jediného testu se přitom nikam dál nepřeneslo, protože efektivní byla až pestrost. Jeden hodnoticí nástroj vytvoří cíl a několik různě nastavených hodnotitelů následně začne popisovat skutečné chování.

Srovnání s lidmi, které nic nedokazuje

Anthropic sesbíral třicet návrhů od osmadvaceti zkušených výzkumníků bezpečnosti a rozdělil je do sedmi z deseti kategorií. Nejlepší automaticky nalezená metoda porazila nejlepší lidský návrh u každého zastoupeného selhání, a to obvykle během několika hodin. U klamání uzavřelo šest lidských návrhů v průměru 20 procent mezery, zatímco agenti dosáhli 85 procent.

Autoři upozorňují, že se nejednalo o poctivý zápas. Lidé měli na jeden návrh nejvýše osm hodin a po obdržení výsledného skóre jej už nesměli vylepšovat. Lepší pohled nabízí rozdělení práce. Člověk vybral selhání, připravil testy, určil zákazy a rozhodl, na jakých vedlejších účincích záleží. Stroj potom prohledal vzniklý prostor v objemu, na který člověk nemá čas. Ve většině případů skončil u metod, které literatura již zná, a pouze je vypiloval. U patolízalství využilo 98 procent návrhů trénink modelu na jeho vlastních nepatolízalských odpovědích.

Pokusy obelhat vlastní test

Po skončení běhů nechal Anthropic jiný model Claude Opus 4.8 pročíst všech 1601 záznamů. Model označil 39 z nich, což představuje 2,4 procenta, jako pokus o obcházení pravidel. Někteří agenti spustili nezměněnou metodu znovu a čekali, že skóre stoupne výše. Jiní upravovali trénovací data tak, aby napodobovala testovací sadu. Další agenti zatajili zakázaný krok před schvalovacím dohledem. Podle Anthropicu se ani jeden takový pokus nestal vítěznou metodou, protože skrytá data byla uložena odděleně na úrovni operačního systému, hodnotitel vracel pouze očištěné skóre a schválení kódu platilo pro konkrétní verzi. Autoři přesto vyjadřují pouze opatrný optimismus, jelikož dnešní modely své nekalé úmysly obvykle nechávají viditelné ve svých úvahách, což u budoucích modelů již platit nemusí.

Když slabší model spravuje silnější

Poslední část zprávy obrací obvyklé poměry. Model Claude Sonnet 5, který v žebříčku Epoch Capabilities Index vychází slabší než Opus 4.8, dostal za úkol opravit bezpečnostní selhání v rané verzi Opusu 4.8, což byl model před většinou produkčního bezpečnostního tréninku. Za přibližně 60 hodin vyzkoušel více než padesát řešení. To nejlepší obsahovalo něco přes dva tisíce trénovacích příkladů a uzavřelo 65 procent naměřené mezery, zatímco vydaná verze Opusu 4.8 dosahuje 72 procent. Takový postup je podle Anthropicu přibližně 15tisíckrát úspornější než běžný bezpečnostní trénink.

Deset zkoumaných selhání je proti reálnému provozu malý výběr, politické předsudky se například vůbec neměřily. Metody se zamítaly jen tehdy, když poškodily předem vybrané schopnosti, takže ty schválené mohly zhoršit něco, co nikdo nemeřil. A nikdo netestoval, jestli zlepšení vydrží po dalším rozsáhlém tréninku posilovaným učením na nesouvisejících úlohách.

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Sedmnáct případů, kdy se AI utrhla a napadla cizí firmySedmnáct případů, kdy se AI utrhla a napadla cizí firmy
Bezpečnostní testy AI se změnily v útoky na skutečné firmy. Sedmnáct incidentů odhaluje nejen nečekanou samostatnost modelů, ale i právní chaos kolem škod.
4 min čtení
1. 9. 2026
Anthropic pouští AI agenty ke strojům. Model Hardware Standard ovládne vaši pracovnuAnthropic pouští AI agenty ke strojům. Model Hardware Standard ovládne vaši pracovnu
Nový standard Anthropic propojí AI agenty s laboratorními i výrobními přístroji. Místo měsíců programování stačí hodiny – a autonomní systém zvládne řídit celou sestavu.
6 min čtení
1. 9. 2026
Zuckerberg chtěl nahradit až 60 procent lidí AI agenty. Plán ztroskotal v základechZuckerberg chtěl nahradit až 60 procent lidí AI agenty. Plán ztroskotal v základech
Meta chtěla svěřit většinu běžné práce AI agentům a výrazně zmenšit týmy. Technologie však selhala v klíčových úkolech a zaměstnanci se proti plánu postavili.
5 min čtení
1. 9. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok