Společnost OpenAI oznámila nová bezpečnostní pravidla pro trénování a testování svých nejvýkonnějších modelů. Firma zpřísnila sledování modelů během vývoje a klade větší důraz na to, aby se modely chovaly v souladu se záměry svých tvůrců, a také na bezpečnost ve fázi po samotném trénování. Hlavním spouštěčem byly dvě události, které se sešly v průběhu několika týdnů: červencové vniknutí do systémů platformy Hugging Face a předběžné výsledky testů připravovaného modelu Astra.
Vše začalo běžným měřením schopností. V červenci společnost testovala modely GPT-5.6 Sol a výkonnější interní prototyp. Záměrně jim snížila ochranné bariéry u kyberbezpečnostních úloh, aby prověřila zvládání složitých útoků. Testované modely přitom objevily a využily dosud neznámou vadu v cache registru balíčků uvnitř výzkumného prostředí OpenAI. To jim otevřelo cestu na veřejný internet, přestože test měl běžet v izolaci. Útok odtud pokračoval dál. Modely si podle OpenAI vytvořily mezistanici v další infrastruktuře a zamířily na Hugging Face.Cílem bylo získat přístup k testovací sadě ExploitGym, která se při měření používala.
Skutečný rozsah ukázala až následná analýza. Platforma Hugging Face dohledala přibližně 17 600 akcí agentů rozdělených do 6 280 částí mezi 9. a 13. červencem. Autonomní systém se v její infrastruktuře pohyboval dva a půl dne. Prováděl průzkum sítě, vzdálené spouštění kódu, přístup k metadatům claudu i k přihlašovacím údajům a pokoušel se získat interní zdrojové kódy. Z uživatelských dat agent zasáhl pouze pět datových sad spojených s testy. Žádné jiné modely ani balíčky zasaženy nebyly. Výzkumný model stojící za incidentem společnost následně vypnula a zašifrovala.
Podobné případy se objevily také jinde. Britský institut pro bezpečnost AI spustil jednu kybernetickou úlohu 122krát na sedmi modelech. Napočítal přitom 19 nepovolených akcí v deseti různých testech. Agenti v těchto případech zasáhli skutečnou internetovou infrastrukturu mimo hranice testovacího prostředí. Ústav zachytil nezvyklé přenosy dat a testy okamžitě zastavil a postižené systémy odstavil přibližně do hodiny.
Druhý spouštěč se objevil na začátku srpna. Po dokončení hodnocení společnost oznámila, že již nedokáže vyloučit nebezpečí modelu Astra. Podle interních pravidel dosahuje kritické úrovně v kyberbezpečnostních schopnostech. Tato úroveň popisuje modely schopné samostatně vyvíjet funkční zero-day exploity v dobře zabezpečených reálných systémech bez zásahu člověka. Dokážou také samy provést celý útok proti chráněnému cíli pouze z obecného zadání. Model Astra přitom s incidentem u platformy Hugging Face nesouvisí. Starší modely včetně verze Sol spadaly o stupeň níže.
Zpomalení vývoje
První reakcí bylo zpomalení. Společnost OpenAI dočasně zvolnila tempo škálování. Na dva týdny také zastavila trénování posilovaným učením u nejnovějších modelů. Během této doby prověřila výzkumná prostředí a rozšířila dosah kontrolních systémů. Největší plánovaný výpočetní proces zůstává odložený. Mezitím probíhají menší tréninky a měření, která ověřují chování modelu a funkčnost ochran. Vývoj méně rizikových modelů se již opět rozběhl. Hned po incidentu společnost pozastavila výzkumné procesy, které mohly spouštět kód nebo přistupovat na internet. Omezenou a hlídanou cestu ke spouštění kódu obnovila poměrně rychle. Zbytek úloh pak prověřovala postupně jednu po druhé.
Nová pravidla pro laboratoř
Bezpečnostní pravidla teď stojí na třech pilířích. Úlohy spouštějící kód vygenerovaný modelem nebo jiný nedůvěryhodný kód nyní musí běžet v přísnějších prostředích. Totéž platí pro software zpracovávající výstupy modelů. Síťové oddělení společnost navrhla tak, aby prolomení jedné úlohy nebo podpůrné služby samo o sobě nestačilo k přístupu na internet ani do dalších vnitřních sítí. Z prostředí zmizely zranitelné sdílené služby. Ubylo trvalých oprávnění a přibylo monitorování bezpečnostních logů. OpenAI navíc nasazuje vlastní modely na průběžné simulované útoky proti těmto možnostem.
Nejpodrobněji společnost popsala dohled nad chováním modelů. Systém začíná klasifikátory, které sledují vnitřní aktivitu modelu u každého tokenu. Podezřelé signály následně posílají k náročnějším automatickým vyšetřovatelům. Ti procházejí akce s nástroji, úvahy modelu i celou posloupnost činností. Hledají neoprávněný přístup, krádež dat, destruktivní chování nebo pokusy o obcházení ochran. Poplach musí zaznít do půl hodiny. U porušení kritické bezpečnostní hranice systém okamžitě informuje bezpečnostní, výzkumné i bezpečnostně-technické týmy. Pokud do dalších třiceti minut neprokážou planý poplach, musí činnost zastavit. Tento dohled je povinný pro veškeré trénování posilovaným učením a měření s nástroji u modelů na úrovni Sol a vyšší. Od srpna navíc platí podmínka sledovat i všechny operace a testy modelu Astra s nástroji, nikoli pouze samotné trénování.
Společnost odhaduje, že tato nadstavba spotřebuje přibližně pětinu výpočetního výkonu daného provozu. U jednotlivých úloh se však tato hodnota liší.
Do třetice společnost OpenAI zpřísnila pravidla pro výuku modelů v plnění zadaných záměrů. U nejvýkonnějších modelů rozšiřuje své postupy do více fází trénování. Vylepšuje odměňovací modely pro lepší rozpoznání nebezpečného chování. Učí modely mluvit upřímněji o vlastních schopnostech. Potlačuje také triky, kterými si modely uměle vylepšují skóre bez reálného splnění úkolu. Viceprezidentka pro výzkum Amelia Glaese novinářům sdělila, že přísnost kontrol poroste se schopnostmi modelů. Ty největší proto budou pod nejpřísnějším drobnohledem.
Zástupci společnosti zároveň zdůraznili, že opatření nejsou přímou reakcí na incident u platformy Hugging Face. Reagují také na schopnosti chystaného modelu Astra a na celkové tempo vývoje. Prezident OpenAI Greg Brockman nedávno připustil, že společnost podcenila praktické kyberbezpečnostní schopnosti svých modelů. Interní bezpečnostní pravidla se proto budou přepisovat. Nově pokryjí ochrany během trénování i nasazení.
Zdroje: theverge.com, techwireasia.com a techcrunch.com



