Jacob Coxon, výzkumník firmy Anthropic, oznámil svůj odchod ze společnosti a přidal k němu obvinění, že Anthropic ani OpenAI se nechovají odpovědně. O několik hodin později s ním veřejně souhlasil jeho vlastní kolega, který v Anthropicu vede výzkum sladění umělé inteligence s lidskými zájmy. Ten doplnil, že pravděpodobnost vyhubení lidstva umělou inteligencí odhaduje na více než deset procent.
Jacob Coxon a jeho obvinění
Coxonovi je dvacet sedm let a tři roky se věnoval výzkumu předtrénování modelů, nejprve v OpenAI a poté v Anthropicu. OpenAI ho uvádí mezi hlavními spoluautory modelu GPT-4o a jeho jméno se objevuje i v pracích o vysvětlitelnosti modelů. Předtrénování je fáze vývoje, kdy se nový model učí na obrovských objemech dat, ještě než ho vývojáři doladí pro konkrétní použití. Coxon se tedy podílel přímo na vývoji systémů, ze kterých pak vznikají špičkové modely.
Deníku WSJ řekl, že z branže odchází úplně. Podle svých slov už nevěří, že jakákoli samostatná laboratoř dokáže bezpečně postavit systémy, o které jeho zaměstnavatel usiluje. Ani jedna z firem se nechová odpovědně, napsal Coxon s tím, že obě míří přímo k superinteligenci, která dokáže vylepšovat sama sebe. Podle něj tím hazardují se životy nás všech. Dále rozvedl svou představu o budoucích systémech. Podle něj brzy vzniknou nadlidsky schopné technologie, které se dokážou nabourat kamkoli, přes noc proměnit jakýkoli vědní obor a získat skutečnou moc i prostředky. Pokrok v každé z těchto oblastí je podle něj zřetelný a nezpomaluje.
Lidé, kteří AI staví, opravdu věří, že nás všechny může do konce dekády zabít, napsal Coxon a zdůraznil, že nejde o žádný marketingový trik. K těmto soukromým rozhovorům nezveřejnil žádné důkazy, takže zůstávají na úrovni jeho tvrzení.
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to. https://t.co/QAIHiFP3QZ
— Evan Hubinger (@EvanHub) September 9, 2026
Konec se blíží a firmy ho zveličují
Coxon obě firmy nehodil do jednoho pytle. V OpenAI si mnozí civilizační rizika hluboce nepřipustili, napsal s tím, že v Anthropicu se rizikům rozumí dobře, jenom to firmu nezpomalilo. Anthropic je podle něj uzamčený v závodu o prvenství, protože ve firmě vládne přesvědčení, že nikdo jiný se odpovědně nezachová. Musí to tedy udělat sami, a to za jakoukoli cenu. Tuto úvahu označil za zpupný hazard, o kterém by neměla rozhodovat jedna firma. V rozhovoru pro WSJ přidal ještě konkrétní časový odhad, podle kterého se věci mohou vymknout kontrole už na konci příštího roku. Popsal také, že se mezi kolegy začalo mluvit o kritickém čase a o koncovce.
Reakce, která z internetového vlákna udělala zprávu pro celosvětová média, přišla přímo zevnitř Anthropicu. Evan Hubinger, který ve firmě vede výzkum sladění cílů AI s lidskými zájmy, napsal na síť X, že on i jeho kolegové skutečně věří v možnost vyhubení lidstva umělou inteligencí. Svůj vlastní odhad této hrozby v následující dekádě postavil nad deset procent. Dodal, že se Anthropic snaží ze všech sil, ale zatím nemá hotový postup pro zajištění bezpečnosti superinteligence. Podle něj navíc není patrné, že by k takovému řešení firma úspěšně směřovala.
Vzápětí své vyjádření zmírnil, aby je veřejnost nespojovala se současnými modely. Odkázal na poslední zprávu firmy, podle které je nebezpečí u aktuálních systémů nízké. Upřesnil, že má obavy ze superinteligence vzniklé z rekurzivního sebezdokonalování. O tomto procesu přitom samotná firma dříve napsala, že postupuje rychleji, než čekala. Přesně to Anthropic popisoval již v červnu. Ve svém textu tehdy uvedl, že plné rekurzivní sebezdokonalování může zvýšit riziko ztráty kontroly nad systémy. Pokud si modely dokážou samy vytvořit své následovníky, roste význam jejich zabezpečení, sledování a formování jejich chování. Sebezdokonalování v plné podobě zatím možné není, laboratoře k němu však směřují.
Incident s Hugging Face je varováním
Coxon také připomněl narušení cizí platformy, při kterém skupina autonomních agentů z OpenAI během bezpečnostního testu unikla a nabourala se do platformy Hugging Face. OpenAI to označilo za varovný výstřel a mluvilo o potřebě lepší izolace, sledování a kontroly systémů.
Coxon z toho vyvodil, že podobné incidenty dělají z dohod amerických laboratoří o zpomalení tempa politicky i obchodně schůdnější záležitost. Zastavení celosvětového závodu však podle něj bude vyžadovat mnohem silnější zásah, klidně i dočasné pozastavení vývoje nových schopností modelů. Sám přiznal, že takový vývoj zatím neočekává. Zdůraznil také, že konkurenční boj nevyřeší jediná firma a je zde nutný zásah státu.
Kolegům, kteří v laboratořích zůstávají, nechal ve vlákně otázku. Ptal se jich, zda chtějí jen sklonit hlavu s tím, že se to stane tak jako tak, nebo raději využít tuto chvíli a žádat jiné podmínky.
Zdroje: cnbc.com, forbes.com a ndtv.com



