OpenAI 30. září 2026 oznámila, že odhalila a zastavila koordinovanou kampaň zaměřenou na neoprávněné získávání chráněného interního uvažování svých modelů. Podle firmy útočníci manipulovali interakcemi s modely, aby se tento obsah objevil v odpovědích. Získané uvažování by mohlo pomoci při trénování či napodobování jiného modelu.
Cílem byl interní postup modelu při řešení úlohy
OpenAI aktivitu označuje za případ adversariální destilace. Tím rozumí systematické využívání výstupů nebo uvažování jednoho modelu bez oprávnění k trénování, reprodukci či zlepšování jiného. Chráněné uvažování popisuje jako interní záznam postupu modelu při řešení úlohy; jeho získání podle firmy může odkrýt i informace, které se do konečné odpovědi nedostanou.
Firma rozlišuje tento způsob útoku od průniku do infrastruktury. Uvádí, že operátoři neprolomili její šifrování, nenapadli databázi ani nezískali přímý přístup k uloženým uživatelským konverzacím. Místo toho koordinovaně manipulovali interakcemi tak, aby model chráněný obsah reprodukoval ve formě viditelné žadateli, což porušovalo podmínky služby.
Jeden z pozorovaných postupů podle OpenAI spočíval v přenášení obsahu mezi konverzacemi. Operátoři zkopírovali zašifrované uvažování z jedné konverzace a v jiné žádali model o jeho dešifrování a přepis. Firma tento postup popisuje jako pokus o extrakci.
Červencové špičky a vazba na lidi spojené s Moonshot AI
Podle časové osy OpenAI začala aktivita 1. července v malém objemu. Výrazné špičky přišly 24. a 25. července, kdy firma zaznamenala 16 000 požadavků s příslušným extrakčním vzorcem od více než 4 000 uživatelů. Tento počet označuje pokusy o získání uvažování, nikoli počet nutně úspěšných extrakcí.
Další vyšetřování podle společnosti odhalilo související vzorce promptů v širší skupině více než 15 000 uživatelů. OpenAI uvádí, že tuto aktivitu plně zastavila do 28. července.
Hlavní skupinu aktivit OpenAI připisuje jednotlivcům spojeným s Moonshot AI, vývojářem Kimi. Toto připsání se týká části pozorované kampaně: firma zároveň uvádí, že není jasné, zda všichni zaznamenaní operátoři pocházeli od jediného aktéra.
Výzkumníci pomohli odhalit další cesty útoku
Související zranitelnosti OpenAI podle jejího vyjádření odpovědně nahlásili také nezávislí bezpečnostní výzkumníci. Jejich zjištění se týkala interakcí mezi modely a zhušťování konverzací. Firma popsané cesty útoku prověřila a potvrdila jejich existenci; práce výzkumníků jí pomohla lépe porozumět této třídě útoků a urychlila zavádění ochran.
Za bezpečnostní riziko OpenAI považuje možné využití získaného uvažování při trénování jiného modelu bez zachování opatření, která chrání uživatelské výstupy původního systému. Ve velkém měřítku podle společnosti může taková destilace urychlit přenos pokročilých schopností, aniž by jej doprovázely odpovídající investice do bezpečnosti.
Blokování účtů a ochrana průběžných výstupů
Reakce podle OpenAI spojila zásahy proti účtům s technickými kontrolami a spoluprací s poskytovateli dalších služeb. Společnost zakázala nebo omezila podvodné účty, zpřísnila kontroly registrací i infrastruktury a rozšířila sledování souvisejících sítí. Pokud aktivita procházela službami třetích stran, spolupracovala s jejich poskytovateli na identifikaci a zablokování zapojených účtů.
Na úrovni modelů firma uvádí posílení ochrany skrytého uvažování mezi uživateli, pracovními prostory, organizacemi i rodinami modelů. Uzavřela cestu, která člověku již držícímu zašifrované uvažování jiného uživatele umožňovala tento obsah znovu předložit a získat jeho znění.
Další zavedené kontroly se podle společnosti zaměřují na výstup odesílaný průběžně. Mají odhalovat a zadržovat obsah, který by mohl zpřístupnit chráněné uvažování.
Ochrany se rozšiřují také k partnerům
OpenAI uvedla, že zjištění sdílela prostřednictvím Frontier Model Forum a příslušných vládních kanálů pro výměnu informací. Cílem bylo umožnit dalším vývojářům pokročilých modelů a partnerům z veřejného sektoru vyhledávat podobnou aktivitu a posílit vlastní ochranu.
Ochranné práce podle firmy pokračují i po zastavení popsané kampaně. Nasazení u partnerů potřebují stejné zabezpečení jako její vlastní služby a útoky vedené přes výstupy nástrojů vyžadují kontroly přesahující běžný viditelný text. OpenAI proto dále zlepšuje obranu nástrojů, pokrytí klasifikátory a odmítání požadavků modely a rozšiřuje příslušné kontroly mezi cloudové partnery.



