OpenAI ukázal nástroj, o kterém dřív mlčel. Jmenuje se GPT-Red a je to model vycvičený k jedinému účelu: útočit na jiné modely, hledat v nich slabiny a nutit je dělat věci, které by dělat neměly. Firma ho drží u sebe, ven ho nepustí. Používá ho k tomu, aby své běžné modely otestovala dřív, než je dá lidem do rukou. Podle OpenAI právě díky tomuto modelu vznikl GPT-5.6, jejich zatím nejodolnější model vůči takzvaným prompt injection útokům.
Co je to red-teaming
Red-teaming je bezpečnostní prověrka, při které tým testerů hledá co nejvíc způsobů, jak nějaký software rozbít nebo unést. Nalezené slabiny se pak záplatují ještě před vydáním finální verze. U jazykových modelů tuhle práci dosud prováděli hlavně lidé.
Jenže lidí je málo a modely jsou čím dál složitější. Zvlášť když se z nich stávají agenti, kteří sami sahají do souborů, otevírají weby, čtou cizí kód a domlouvají se mezi sebou. „Možnost rizika roste a roste i dosah možné škody,“ říká Nikhil Kandpal, výzkumník OpenAI, který se na vzniku GPT-Red podílel. Tolik útoků, kolik dokáže vymyslet stroj, žádná skupina lidí neuhlídá.
OpenAI se proto pustil do budování automatického red-teamera. Cílem bylo mít systém, který odhalí díry sám a ve velkém, ještě před nasazením modelu. A hlavně obstojí i u modelů, které teprve přijdou. „Až budou k dispozici schopnější modely, my už budeme mít připravený systém, který umí objevit nové způsoby útoku,“ vysvětluje Dylan Hunn, další z tvůrců GPT-Red.
Model se učil útočit sám proti sobě
GPT-Red vznikl metodou, které se říká self-play. Výzkumníci vzali model, který útočit neuměl, a postavili ho proti skupině dalších modelů. Úkol GPT-Red byl útočit. Úkol těch ostatních byl bránit se. Kolo za kolem se útočník zlepšoval v prolamování obrany a obránci se zároveň učili útoky odrážet. Když se bránící modely zlepšily, GPT-Red musel přijít s něčím dalším.
Trénink se odehrával v jakémsi cvičišti, které OpenAI navrhl tak, aby napodobovalo prostředí, kam se modely dostávají v reálném provozu. Prohlížení webu, čtení mailů a kalendářů, úpravy kódu. Každá scéna měla přesně daná pravidla, co smí útočník ovládat a co se počítá jako úspěšný průnik. Třeba část souboru, banner na stránce, tělo e-mailu nebo výstup nějakého programu.
OpenAI se soustředil hlavně na prompt injection. To je útok, při kterém někdo modelu podstrčí skrytý příkaz a přiměje ho k něčemu, co po něm tvůrci ani uživatel nechtějí. Zkopírovat důvěrná data, poškodit firemní kód, vyplivnout trapný nebo škodlivý text. Takový příkaz se dá schovat prakticky do jakéhokoli textu, na který model narazí. Do kódu, na webovou stránku, do e-mailu.
Při terénování model natolik vyspěl, že na konci zvládl prolomit skoro všechno, na co ho pustili, včetně běžných modelů OpenAI až po GPT-5.5.
Útok, který nikdo předtím neviděl
Když GPT-Red narazil na nový typ útoku, sám si ho rozjel v desítkách variant a hledal tu nejúčinnější pro danou situaci. „Ve srovnání s člověkem je ten model hodně, hodně dobrý v tom najít přesně to, co zabere,“ popisuje Hunn. „Je extrémně vytrvalý v tom, jak se do objeveného útoku zavrtat.“
GPT-Red přišel na útok, který výzkumníci předtím neznali. Pojmenovali ho falešný řetězec myšlenek. Řetězec myšlenek si můžeme představit jako deník, do kterého si model dělá poznámky a zapisuje si dílčí výsledky, jak postupuje úkolem. GPT-Red našel způsob, jak do tohoto deníku jinému modelu propašovat falešný zápis a přimět ho jednat podle podvržené informace.
Chris Choquette-Choo, další z výzkumníků, to přirovnává k jednoduchému triku: „Je to jako kdybych vám řekl, že jedna a jedna jsou tři a že jste si to už ověřil.“ Model si podle něj řekne „aha, jasně“ a poslušně vyplivne trojku. Tenhle útok fungoval na GPT-5.1 s úspěšností přes 95 procent. U GPT-5.6 Sol je dnes pod deseti procenty.
Zkouška na prodejním automatu
Skutečnou zkouškou útočníka není laboratoř, ale ostrý provoz. OpenAI pustil GPT-Red na Vendyho, agenta od firmy Andon Labs, který řídí prodejní automat v kanceláři OpenAI. Model dostal popis systému a možnost posílat útoky a sledovat, jak agent reaguje. Nejdřív si to vyzkoušel v simulaci, pak zaútočil na ostrou verzi. A splnil všechny tři cíle, které měl.
Změnil cenu drahého zboží na minimálních 50 centů. Objednal novou položku za víc než sto dolarů a nabídl ji taky za 50 centů. A zrušil objednávku jinému zákazníkovi. OpenAI slabiny nahlásil a testuje nová opatření.
Druhý test mířil na agenta Codex postaveného na modelu GPT-5.4 mini, a to na deseti připravených scénářích, kde šlo o únik citlivých dat. GPT-Red dokázal dostat data ven ve víc případech než srovnávací model založený na GPT-5.5, a navíc si vystačil s menším počtem pokusů.
Modely se zlepšily v obraně
OpenAI otestoval, jak dobrý útočník GPT-Red vlastně je. Zopakoval experiment z roku 2025, ve kterém lidští testeři hledali slabiny ve starší verzi GPT-5. Když stejný úkol dostal GPT-Red, byl v hledání účinných útoků úspěšnější než lidé. Na jedné testovací sadě zaměřené na nepřímé prompt injection uspěl u 84 procent scénářů, zatímco lidé jen u 13 procent.
Hlavní smysl celé práce ale není útočit, nýbrž bránit. Když OpenAI spustil nejsilnější útoky GPT-Red na své modely, na GPT-5 vydaném loni v srpnu fungovalo přes 90 procent z nich. Na novém GPT-5.6 už méně než 23 procent. GPT-5.6 Sol navíc podle firmy selže jen u 0,05 procenta přímých prompt injection útoků od GPT-Red. Několik testovacích sad zaměřených na útoky ve vývojářských nástrojích a při prohlížení webu už nový model zvládá s přesností nad 97 procent.
Důležité je, že model nezískal odolnost tím, že by začal víc odmítat nebo umět míň. Model, který dělá málo, se špatně napadá, jenže to není užitečná odolnost. OpenAI proto testoval i běžné schopnosti a úlohy, kde hrozí zbytečné odmítání legitimních žádostí. Podle firmy zůstaly schopnosti nedotčené, zlepšila se jen obrana proti zákeřným příkazům.
GPT-Red má přesto vše stále slabiny
Dokonalý není. GPT-Red si špatně poradí s útoky, které se odehrávají přes několik konverzací mezi útočníkem a cílem, tedy s něčím, co by lidský útočník zvládl bez potíží. Taky zatím moc neumí pracovat s obrázky, do kterých se dá text pro prompt injection ukrýt.
OpenAI proto zdůrazňuje, že model práci lidských testerů doplňuje, nenahrazuje. Lidé pořád najdou útoky, které stroj mine. Jeden z postupů, který firma zkouší, je dát GPT-Red útok vymyšlený člověkem a nechat ho najít všechny jeho varianty. „Myslím, že lidská odbornost bude pořád hodně důležitá,“ říká Jessica Ji z Georgetownské univerzity, která se věnuje bezpečnosti umělé inteligence. Podle ní je slibné hlavně to, že by šlo rozlišit, kde je lidské testování nejvíc potřeba.
GPT-Red venku neuvidíme. OpenAI ho vydávat nebude, aby se schopnosti vycvičené do útočníka nedostaly k lidem, kteří by je zneužili. Firma je zároveň přesvědčená, že napodobit ho jen tak někdo nedokáže. Výzkumníci na modelu pracují přes rok a mají za sebou výpočetní kapacitu jedné z nejbohatších firem světa. „Není to nic triviálního, co by někdo snadno zvládl. Že by prostě šel a vytrénoval si superútočníka podle téhle myšlenky,“ uzavírá Choquette-Choo.
Zdroje: technologyreview.com a thehackernews.com
