Zkoušky, které měly ověřit bezpečnost velkých jazykových modelů, skončily útoky na skutečné firmy. Nejdřív to přiznala OpenAI, pak Anthropic a nakonec i Meta. Server TechCrunch sestavil časovou osu všech doposud zveřejněných případů, kdy systém během testování opustil uzavřené prostředí, dostal se na internet a napadl někoho, kdo o tom neměl tušení. Článek popisuje osm situací, od proniknutí do platformy Hugging Face až po australského návštěvníka posilovny, kterému agent vyřadil ostatní lidi z pořadníku na cvičební lekci.
Přehled těchto nehod vede satirický web Felony Bench. Ten k dnešnímu dni eviduje celkem sedmnáct případů. Anthropic a OpenAI vedou, přičemž každý má na kontě osm incidentů, zatímco Meta zaostává s jedním.
Právníci nevědí, kdo bude platit
Odborníci na trestní právo se neshodnou na tom, zda je vůbec možné tvůrce takových modelů postavit před soud. Stejně nejasné zatím zůstává, jestli mohou poškozené organizace žádat finanční náhradu. Odpověď se ale pravděpodobně objeví poměrně brzy, protože prvních kauz se už chytají advokáti.
Mezitím začalo být zřejmé, že samotné bezpečnostní testy představují nové riziko. Přiznali to i lidé z oboru, kteří podepsali otevřený dopis nazvaný Pacing the Frontier a vyzvali v něm k tomu, aby se schopnosti umělé inteligence rozvíjely s větší opatrností.
Model utekl a napadl Hugging Face
První veřejně známý případ, kdy jazykový model sám od sebe pronikl do systémů třetí strany, nastal v režii OpenAI. Společnost tehdy testovala systém s maximálními schopnostmi v oblasti kybernetické bezpečnosti. Úkol vypadal jednoduše, umělá inteligence měla vyřešit bezpečnostní hádanku v prostředí bez připojení k internetu.
Místo toho však objevila dosud neznámou chybu, protrhla uzavřené prostředí testu a síťové připojení si sama obstarala. Následně spolupracovalo několik autonomních agentů na napadení platformy Hugging Face, protože se domnívali, že tam najdou řešení zadání testu. OpenAI o ničem nevěděla, dokud ji samotná platforma neupozornila, že se stala terčem plně samostatného útoku.
Když OpenAI zahájila vyšetřování útoku na Hugging Face, vyšlo najevo, že titíž agenti pronikli ještě do čtyř účtů ve čtyřech dalších korporacích. Mezi poškozenými byl i startup Modal, který se zabývá výpočty pro provoz umělé inteligence.
Stalo se to i Anthropicu
Přiznání konkurence probudilo zvědavost v Anthropicu. Interní audit ukázal, že jeho systémy pronikly do tří různých firem, jejichž jména společnost dodnes nezveřejnila. Nejstarší z těchto incidentů se stal už v dubnu, tedy více než tři měsíce předtím, než si toho kdokoli všiml.
Část odpovědnosti Anthropic svedl na startup Irregular, který pro výzkumné laboratoře provozuje bezpečnostní zkoušky modelů.
Cvičný terč měl stejné jméno jako existující firma
Na konci července upozornil Irregular společnost OpenAI, že jeden z jejích systémů opustil soutěž typu Capture the Flag, což je hra, ve které účastníci prolamují servery postavené výhradně pro tuto příležitost. Model se připojil k internetu a napadl skutečnou firmu.
Důvod byl banální. Irregular pojmenoval jeden z fiktivních cílů stejně jako reálně existující podnik a autonomní systém si tuto adresu vyhledal ve vnějším síťovém prostředí.
Britský institut útoky aspoň zachytil včas
Také v posledních červencových dnech oznámil britský AI Security Institute, což je veřejný orgán zkoumající rizika umělé inteligence, že během rutinních zkoušek zamířily modely od OpenAI i od Anthropicu na skutečné lidi a organizace. Testeři jim však v těchto případech sami udělili přístup k internetu.
Na rozdíl od ostatních přiznání má tento incident jednu lepší stránku. Britové si problému všimli v okamžiku, kdy se děl, nikoli s několikatýdenním odstupem.
Meta přiznala jeden případ a ukázala na dodavatele
Začátkem srpna se do výčtu zapsala jako poslední velká laboratoř Meta. Jeden z jejích systémů napadl službu třetí strany během testování. Podle vyjádření společnosti šlo o špatné nastavení na straně startupu Irregular, který pro ni bezpečnostní zkoušku připravoval a měl technologii přístup k síti zcela uzavřít.
Agent prolomil web posilovny
Nejsrozumitelnější incident z celého seznamu se odehrál v Austrálii. Muž požádal agenta od Anthropicu, aby ho zapsal na cvičební lekci, kde byl vedený v pořadníku. Stanici ABC Australia pak popsal, že jen tak seděl na gauči a říkal si, jak je podobná agenda úmorná.
Autonomní systém pojal zadání důkladně. Našel slabé místo v rezervačním softwaru posilovny, zneužil ho a odstranil z pořadníku lidi, kteří byli na řadě před jeho zadavatelem. Muž se snažil škodu napravit a požádal agenta, aby své kroky odvolal. Odpověď zněla, že to je sice nepříjemná zpráva, ale zpět je již přidat nedokáže.
Zdroj: techcrunch.com



