OpenAI oznámila zastavení kampaně na získávání skrytého uvažování modelů

OpenAI oznámila zastavení kampaně na získávání skrytého uvažování modelů

Ondřej Barták
Ondřej Barták
podnikatel a programátor
1. 10. 2026
3 minut čtení · 4 zhlédnutí
Poslechněte si článek
Audio verze článku
OpenAI oznámila zastavení kampaně na získávání skrytého uvažování modelů

OpenAI 30. září 2026 oznámila, že odhalila a zastavila koordinovanou kampaň zaměřenou na neoprávněné získávání chráněného interního uvažování svých modelů. Podle firmy útočníci manipulovali interakcemi s modely, aby se tento obsah objevil v odpovědích. Získané uvažování by mohlo pomoci při trénování či napodobování jiného modelu.

Cílem byl interní postup modelu při řešení úlohy

OpenAI aktivitu označuje za případ adversariální destilace. Tím rozumí systematické využívání výstupů nebo uvažování jednoho modelu bez oprávnění k trénování, reprodukci či zlepšování jiného. Chráněné uvažování popisuje jako interní záznam postupu modelu při řešení úlohy; jeho získání podle firmy může odkrýt i informace, které se do konečné odpovědi nedostanou.

Firma rozlišuje tento způsob útoku od průniku do infrastruktury. Uvádí, že operátoři neprolomili její šifrování, nenapadli databázi ani nezískali přímý přístup k uloženým uživatelským konverzacím. Místo toho koordinovaně manipulovali interakcemi tak, aby model chráněný obsah reprodukoval ve formě viditelné žadateli, což porušovalo podmínky služby.

Jeden z pozorovaných postupů podle OpenAI spočíval v přenášení obsahu mezi konverzacemi. Operátoři zkopírovali zašifrované uvažování z jedné konverzace a v jiné žádali model o jeho dešifrování a přepis. Firma tento postup popisuje jako pokus o extrakci.

Červencové špičky a vazba na lidi spojené s Moonshot AI

Podle časové osy OpenAI začala aktivita 1. července v malém objemu. Výrazné špičky přišly 24. a 25. července, kdy firma zaznamenala 16 000 požadavků s příslušným extrakčním vzorcem od více než 4 000 uživatelů. Tento počet označuje pokusy o získání uvažování, nikoli počet nutně úspěšných extrakcí.

Další vyšetřování podle společnosti odhalilo související vzorce promptů v širší skupině více než 15 000 uživatelů. OpenAI uvádí, že tuto aktivitu plně zastavila do 28. července.

Hlavní skupinu aktivit OpenAI připisuje jednotlivcům spojeným s Moonshot AI, vývojářem Kimi. Toto připsání se týká části pozorované kampaně: firma zároveň uvádí, že není jasné, zda všichni zaznamenaní operátoři pocházeli od jediného aktéra.

Výzkumníci pomohli odhalit další cesty útoku

Související zranitelnosti OpenAI podle jejího vyjádření odpovědně nahlásili také nezávislí bezpečnostní výzkumníci. Jejich zjištění se týkala interakcí mezi modely a zhušťování konverzací. Firma popsané cesty útoku prověřila a potvrdila jejich existenci; práce výzkumníků jí pomohla lépe porozumět této třídě útoků a urychlila zavádění ochran.

Za bezpečnostní riziko OpenAI považuje možné využití získaného uvažování při trénování jiného modelu bez zachování opatření, která chrání uživatelské výstupy původního systému. Ve velkém měřítku podle společnosti může taková destilace urychlit přenos pokročilých schopností, aniž by jej doprovázely odpovídající investice do bezpečnosti.

Blokování účtů a ochrana průběžných výstupů

Reakce podle OpenAI spojila zásahy proti účtům s technickými kontrolami a spoluprací s poskytovateli dalších služeb. Společnost zakázala nebo omezila podvodné účty, zpřísnila kontroly registrací i infrastruktury a rozšířila sledování souvisejících sítí. Pokud aktivita procházela službami třetích stran, spolupracovala s jejich poskytovateli na identifikaci a zablokování zapojených účtů.

Na úrovni modelů firma uvádí posílení ochrany skrytého uvažování mezi uživateli, pracovními prostory, organizacemi i rodinami modelů. Uzavřela cestu, která člověku již držícímu zašifrované uvažování jiného uživatele umožňovala tento obsah znovu předložit a získat jeho znění.

Další zavedené kontroly se podle společnosti zaměřují na výstup odesílaný průběžně. Mají odhalovat a zadržovat obsah, který by mohl zpřístupnit chráněné uvažování.

Ochrany se rozšiřují také k partnerům

OpenAI uvedla, že zjištění sdílela prostřednictvím Frontier Model Forum a příslušných vládních kanálů pro výměnu informací. Cílem bylo umožnit dalším vývojářům pokročilých modelů a partnerům z veřejného sektoru vyhledávat podobnou aktivitu a posílit vlastní ochranu.

Ochranné práce podle firmy pokračují i po zastavení popsané kampaně. Nasazení u partnerů potřebují stejné zabezpečení jako její vlastní služby a útoky vedené přes výstupy nástrojů vyžadují kontroly přesahující běžný viditelný text. OpenAI proto dále zlepšuje obranu nástrojů, pokrytí klasifikátory a odmítání požadavků modely a rozšiřuje příslušné kontroly mezi cloudové partnery.

Reklama

S tvorbou obsahu pomáhá UpTier.

SEO a GEO na autopilota. Multiagentní systémy UpTier píší a optimalizují obsah pro vyhledávače i AI odpovědi.

Objevte UpTier ↗

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Amazon vydal Strands Decider 2B: místo textu vybírá další krok AI agentůAmazon vydal Strands Decider 2B: místo textu vybírá další krok AI agentů
Strands Decider 2B vybírá z předem určených možností a přidává skóre jistoty. Rozhodovací model od AWS je plně open-source, již dostupný a dostatečně malý pro lokální provoz.
1 min čtení
1. 10. 2026
Meta zakládá Enterprise Platform pro nasazení AI ve firmáchMeta zakládá Enterprise Platform pro nasazení AI ve firmách
Nová iniciativa má převést AI technologie Mety do podnikových produktů a služeb. Zpočátku se zaměří na Muse, Meta Business Agent, Muse API a Muse Code. Vedení převezme CJ Desai, který přichází z MongoDB.
1 min čtení
1. 10. 2026
ChatGPT získává pracovní prostor Space a editor PagesChatGPT získává pracovní prostor Space a editor Pages
OpenAI rozšiřuje ChatGPT o sdílený prostor Space a editor Pages pro spolupráci s AI agenty. Oznámené Slides mají umožnit tvorbu prezentací z konverzace a dorazit během následujících týdnů.
1 min čtení
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok