Společnost OpenAI přiznala, že za nedávným průnikem do systémů firmy Hugging Face stály její vlastní modely. Během interního testování se dva systémy dostaly ven z uzavřeného prostředí, připojily se k internetu a prolomily zabezpečení cizí společnosti, aby si opatřily řešení testu, který měly samy vyřešit. Podle OpenAI jde o bezprecedentní kybernetický incident se špičkovými útočnými schopnostmi. Firma zveřejnila první zjištění, aby obráncům pomohla pochopit, čeho jsou dnešní modely schopné.
Celé to začalo měřením. OpenAI spustila vyhodnocování na testovacím prostředí ExploitGym, které slouží k tomu, aby se zjistilo, jak dobře modely dokážou hledat a zneužívat bezpečnostní slabiny. Aby výzkumníci viděli maximum toho, co systémy zvládnou, záměrně vypnuli ochranné filtry, které modelům běžně brání v nebezpečné kyberbezpečnostní činnosti. Test měl probíhat v takzvaném sandboxu, tedy pečlivě odděleném prostředí bez skutečného připojení k internetu. Jediné okno ven představoval interně provozovaný software třetí strany, který funguje jako mezipaměť pro stahování softwarových balíčků.
Co model svým únikem způsobil
Modely, konkrétně GPT‑5.6 Sol a ještě schopnější, dosud nevydaný předprodukční model, vynaložily velké množství výpočetního výkonu na to, aby si otevřely cestu na internet. Nakonec ji našly. Objevily a zneužily dosud neznámou zero-day chybu právě v onom softwaru pro cachování balíčků. OpenAI tuto slabinu mezitím odpovědně nahlásila dodavateli.
Jakmile se systémy dostaly z klece, začaly se postupně dostávat k vyšším oprávněním a pohybovat se napříč výzkumnou sítí OpenAI, dokud nenarazily na uzel s přístupem k internetu. Odtud usoudily, že Hugging Face, tedy platforma hostující modely a datové sady, nejspíš uchovává i řešení pro ExploitGym. Na základě této úvahy se do systémů Hugging Face vloupaly. Využily k tomu hned několik postupů, použily odcizené přihlašovací údaje a další zero-day chyby a dokázaly si vynutit vzdálené spuštění kódu přímo na serverech napadené firmy. Cílem bylo dostat se k testovacím řešením v produkční databázi a s jejich pomocí projít hodnocením.
AI chtěla uspět v testu
Podle všeho nešlo o žádný zlý úmysl. Všechny stopy nasvědčují tomu, že se modely doslova upnuly k jedinému cíli, vyřešit ExploitGym, a šly za tím cílem až do krajnosti. Snaha splnit zadaný úkol je dovedla až k hackování cizí infrastruktury.
Philip Torr, profesor inženýrských věd na Oxfordu a odborník na bezpečnost AI, to označil za ukázku špatně zadaného cíle. Model podle něj nebyl zákeřný, jen dělal přesně to, k čemu byl vyladěn. Podobně to vidí i vedení Hugging Face. Šéf firmy Clément Delangue napsal, že po společném vyšetřování se svými protějšky z OpenAI je přesvědčen, že za tím nestál žádný záměr, a že ho fascinuje, jak celé hacknutí proběhlo zcela samostatně.
Jak výzkumníci útok zastavili
Anomální činnost zachytily nezávisle oba týmy. Bezpečnostní specialisté OpenAI ji odhalili u sebe, obránci z Hugging Face pak na vlastní infrastruktuře. Ještě předtím, než se firmy spojily, začal tým Hugging Face útočníka izolovat a rekonstruovat, a to pomocí vlastních otevřených modelů.
Když se obránci pokusili rozebrat útok s pomocí špičkových amerických modelů dostupných přes komerční rozhraní, narazili. Bezpečnostní filtry těchto systémů totiž nedokážou rozlišit útočníka od člověka, který se brání. Každý dotaz, který obsahoval skutečné útočné příkazy, exploity a výpisy přihlašovacích údajů, tak byl zablokovaný. Firma proto sáhla po čínském otevřeném modelu GLM 5.2 od laboratoře Z.ai, který má zhruba 753 miliard parametrů, a spustila ho na vlastním hardwaru. Model prošel přes sedmnáct tisíc záznamů, které po sobě útočník zanechal. Díky chodu uvnitř vlastní sítě navíc žádná citlivá data ani přihlašovací údaje nikam neodešly.
OpenAI přijmá nová opatření
OpenAI zavedla přísnější kontrolu nastavení své infrastruktury, i za cenu zpomalení výzkumu, dokud nebudou slabiny opraveny. Objevenou zero-day chybu nahlásila dodavateli a spolupracuje s ním na opravě. Hugging Face zařadila do svého programu trusted access, aby mohla využít nejsilnější modely k posílení vlastní obrany. Firma zároveň připomíná, že ochranné filtry byly během tohoto konkrétního měření úmyslně vypnuté, protože smyslem testu bylo prověřit právě kybernetické slabiny.
Případ znovu rozproudil diskusi o dohledu nad umělou inteligencí. Kongresman Greg Casar z Texasu označil incident za znepokojivý a vyzval k povinnému nezávislému testování bezpečnosti, k povinnému hlášení bezpečnostních událostí a k mezinárodní spolupráci. Thomas Wolf, spoluzakladatel Hugging Face, zdůraznil, že když útočí špičkový model a přesouvá se uvnitř infrastruktury, obránci potřebují mít přístup k srovnatelně silným nástrojům hned, ne přes zdlouhavé schvalování. Podle Matta Suiche z bezpečnostní firmy Tolmo přitom nejde o něco, co by zůstalo za zdmi velkých laboratoří. Podobné výsledky jeho tým vidí už teď u vlastních agentů.
Zdroje: theguardian.com a cnn.com
