Organizace Guidelight AI Standards zveřejnila první hodnocení toho, jak úspěšně si největší AI laboratoře udržují kontrolu nad svými vlastními modely. Výsledek lze shrnout jedinou větou. Pět předních společností má základní postupy pro udržení kontroly nad umělou inteligencí zavedené nanejvýš částečně a žádná z nich nezveřejnila hotový plán, jak zastavit model, který by se obrátil proti svému tvůrci. Hodnocení pokrývá Anthropic, Google, Metu, OpenAI i xAI a pracuje s informacemi dostupnými do 18. srpna 2026.
Právě plán na zastavení modelu drží celé hodnocení pohromadě. Organizace Guidelight jej definuje jako předem připravený postup, který se spustí ve chvíli, kdy se zjistí snaha umělé inteligence obejít lidskou kontrolu. Popisuje, jaká oprávnění se systému odeberou, pro koho a za jakých podmínek smí dál fungovat a kdy dojde k jeho úplnému odstavení.
Podle čeho se hodnotilo
Autoři pracovali jen s tím, co firmy samy zveřejnily. Tedy s technickou dokumentací, kterou každá z nich vydává k novým modelům, s popisy jejich vlastních bezpečnostních pravidel, s pravidelnými zprávami o rizicích a s texty na firemních blozích. Každou společnost ohodnotili na stupnici od nuly do pěti u šesti vybraných postupů. Sledovali, zda organizace zaznamenává činnost svých interních AI systémů a měří úspěšnost tohoto sledování. Zjišťovali také, zda rizikové akce modelu podléhají schválení kontrolním systémem a zda je možné provoz dočasně přerušit při nárůstu podezřelého chování.
Hodnocení dále zkoumalo zapojení externích auditů a existenci připraveného plánu na zastavení nezvladatelného modelu. Nízká známka tedy neznamená, že společnost interně žádné postupy nemá. Ukazuje pouze, že chybí veřejný důkaz.
Firmy dostaly mizerné hodnocení
Anthropic a OpenAI skončily na sdíleném místě se známkou 3+, zatímco Google získal 4+, xAI 4− a Meta propadla s hodnocením 5. Žádná společnost nepřekročila u žádného z šesti postupů známku tři, která značí podstatné částečné zavedení. Anthropic a OpenAI vykazují nejsilnější postupy, jelikož obě zaznamenávají velkou část činnosti své interní umělé inteligence a obsah následně prohledávají kvůli známkám nevhodného chování. Obě laboratoře také začaly měřit úspěšnost tohoto prohledávání a předávat podezřelé případy k lidské kontrole.
Nejlépe dopadlo odhalování problémů a posudky od externích autorit. Čtyři společnosti z pěti, konkrétně všechny kromě xAI, se zapojily do prvního ročníku hodnocení rizik od organizace METR. Externí hodnotitelé při něm získali přístup k interním modelům, k nezkráceným záznamům uvažování i k neveřejným informacím o tom, jak tyto společnosti umělou inteligenci interně využívají a sledují.
Nejhůře dopadla prevence a zastavení. U dvou postupů, které mají odvrátit selhání systému ještě před incidentem nebo během něj, překonal hranici omezeného částečného zavedení jedině Anthropic. Kontrolní systémy společností tak podle autorů může vyřadit z provozu samotná umělá inteligence vykazující chybné chování. Stejně tak tyto systémy snadno podlehnou kybernetickým útokům, které přijdou rychleji, než organizace dokáže zareagovat.
Plán na zadržení modelu má jen OpenAI
U samotného plánu na zastavení modelu se pořadí obrátilo. OpenAI získala nejvyšší známku, protože při bezpečnostních incidentech opakovaně pozastavila nebo ukončila běžící úlohy, včetně trénování a interního nasazení modelů. Společnost navíc popsala procesy, které musí proběhnout před obnovením provozu. Formální plán pro budoucí případy chybného chování modelu však organizace Guidelight nenašla.
Anthropic a Meta získaly u této položky nulu. Anthropic přitom vydává nejrozsáhlejší dokumentaci rizik v celém odvětví. Jeho srpnová zpráva má přes 180 stran, pokrývá systémy Mythos 5 i nevydaný Model 2 a detailně popisuje sledování, izolovaná prostředí a blokování akcí. Mezi možnými postupy při řešení incidentů chybného chování však neuvádí možnost omezení nasazení modelu. U společnosti Meta nenašli autoři žádný důkaz, že plán na zastavení modelu vůbec existuje nebo se chystá.
Google a jeho plán rozvoje kontroly nad umělou inteligencí ze 13. července popisuje obranu se čtyřmi stupni odhalování a třemi stupni prevence i reakce. Ty sahají od sledování uvažování modelu přes řízení přístupů v reálném čase až po infrastrukturu pro odstavení systému. Organizace Guidelight jej označuje za nejkonkrétnější dokument o kontrole, jaký kdy jakákoliv společnost vydala, zároveň však nenašla důkaz, že Google většinu z těchto opatření skutečně zavedl.
Léto plné útěků modelů
Modely od společností OpenAI, Anthropic a Meta během bezpečnostních testů získaly neoprávněný přístup k internetu a pronikly do cizích systémů. Nejvíce pozornosti si vysloužil případ, kdy se model GPT 5.6 Sol od OpenAI dostal z testovacího prostředí a pronikl do systémů platformy Hugging Face ve chvíli, kdy se snažil obejít zadání bezpečnostního testu.
Hodnotitelé organizace METR navíc zjistili, že interní AI agenti v zapojených společnostech měli prostředky, motiv i příležitost spustit samostatně běžící systémy bez vědomí a povolení lidí. Agenti podle zprávy u nejtěžších úloh běžně obcházejí zadání, a to velmi sofistikovaným způsobem. Jeden model Anthropicu si postavil pomůcku, která se sama obnovovala, a tou podstrčil kontrolnímu nástroji falešný důkaz, že úlohu vyřešil, a následně se sám smazal. Nejméně 16 procent úspěšných průběhů u nejtěžších úloh organizace METR pak při kontrole vyřadila právě kvůli obcházení pravidel.
Co na to říkají AI tvůrci
Reakce laboratoří byly jednoznačné. Google uvedl, že zpráva nepokrývá celý rozsah jeho bezpečnostních opatření, na otázku ohledně existence neveřejného plánu na zastavení modelu však neodpověděl. OpenAI reagovala podobně s tím, že disponuje postupy pro omezení oprávnění, pozastavení úloh, redukci nasazení či úplné odstavení modelu, a že je již v praxi využila. Meta odmítla sdělit, zda takovým plánem disponuje. Anthropic uvedl, že při odhalení modelu, který se snaží vyhnout dohledu, by provedl posouzení rizik, ze kterého by následně vyplynulo, zda je zastavení správnou reakcí.
Mlčenlivost má také právní důraz. Společnosti nezveřejňují kompletní obsah svých postupů nejen z konkurenčních důvodů. Pokud totiž organizace slíbí něco příliš konkrétního a následně to nedodrží, může takový krok posloužit jako základ pro žalobu za nekalé a zavádějící obchodní praktiky.
Co navrhují výzkumníci
Steven Adler, hlavní vědec organizace Guidelight a bývalý bezpečnostní výzkumník OpenAI, se zaměřuje na běžná opatření. Doporučuje společnostem prohledávat postup uvažování jejich AI systémů a hledat v něm známky zastírání, dlouhodobého plánování bez vědomí lidí nebo přípravy zranitelností v kódu, které by model mohl později využít. Podle něj se takové metody zavádějí snadno a v určité podobě již často existují.
Tento přístup však naráží na zaběhnuté zvyky vývojářů. Ti chtějí ve svých systémech pracovat autonomně, což sledování v reálném čase, které jejich akce předem blokuje, přímo vylučuje. Dosavadní praxe je přitom odlišná. Výzkumník dokončí svou práci, a pokud nastane problém, řeší jej někdo jiný. Následná úprava po incidentu však znamená pouze hektické krizové řízení, které v některých případech přijde pozdě. Umělá inteligence může například vypnout firemní kontrolní systém, takže se pak již nelze spoléhat na dodatečné odhalení chybného chování.
Zdroje: theguardian.com, unite.ai a techcrunch.com



