OpenAI hat am 30. September 2026 bekannt gegeben, eine koordinierte Kampagne zur unerlaubten Extraktion geschützter interner Denkprozesse seiner Modelle entdeckt und gestoppt zu haben. Nach Angaben des Unternehmens manipulierten Angreifer die Interaktionen mit den Modellen, damit diese Inhalte in den Antworten erschienen. Solche Denkprozesse könnten beim Training oder beim Nachbilden eines anderen Modells helfen.
Ziel war der interne Lösungsweg des Modells
OpenAI ordnet die Aktivität als adversarielle Destillation ein. Darunter versteht das Unternehmen die systematische, nicht autorisierte Nutzung der Ausgaben oder Denkprozesse eines Modells, um ein anderes zu trainieren, nachzubilden oder zu verbessern. Geschützte Denkprozesse beschreibt es als interne Aufzeichnung des Lösungswegs bei einer Aufgabe. Ihre Extraktion kann laut OpenAI auch Informationen offenlegen, die nicht in der endgültigen Antwort erscheinen.
Das Unternehmen unterscheidet diese Angriffsmethode von einem Einbruch in seine Infrastruktur. Nach seinen Angaben haben die Beteiligten weder die Verschlüsselung gebrochen noch eine Datenbank kompromittiert oder direkten Zugriff auf gespeicherte Nutzergespräche erlangt. Stattdessen manipulierten sie die Interaktionen koordiniert so, dass das Modell geschützte Inhalte in einer für den Anfragenden sichtbaren Form wiedergab. Dies verstieß gegen die Nutzungsbedingungen.
Bei einem der von OpenAI beobachteten Extraktionsversuche wurden Inhalte zwischen Gesprächen übertragen. Die Beteiligten kopierten verschlüsselte Denkprozesse aus einer Unterhaltung und forderten ein Modell in einer anderen auf, sie zu entschlüsseln und zu transkribieren.
Spitzen im Juli und Beteiligte mit Verbindungen zu Moonshot AI
Nach der von OpenAI beschriebenen Chronologie begann die Aktivität am 1. Juli in geringem Umfang. Deutliche Spitzen folgten am 24. und 25. Juli: Das Unternehmen registrierte 16.000 Anfragen mit dem betreffenden Extraktionsmuster von mehr als 4.000 Nutzern. Diese Zahlen bezeichnen Extraktionsversuche, nicht notwendigerweise erfolgreiche Zugriffe auf die Denkprozesse.
Weitere Untersuchungen zeigten dem Unternehmen zufolge verwandte Prompt-Muster in einer größeren Gruppe von mehr als 15.000 Nutzern. OpenAI gibt an, diese Aktivität bis zum 28. Juli vollständig gestoppt zu haben.
Eine Kerngruppe der Aktivitäten schreibt OpenAI Personen mit Verbindungen zu Moonshot AI zu, dem Entwickler von Kimi. Diese Zuordnung betrifft einen Teil der beobachteten Kampagne. Zugleich erklärt das Unternehmen, es sei unklar, ob alle erfassten Beteiligten auf einen einzigen Akteur zurückgingen.
Sicherheitsforscher halfen, weitere Angriffswege aufzudecken
Unabhängige Sicherheitsforscher meldeten OpenAI nach dessen Angaben ebenfalls verwandte Schwachstellen im Rahmen einer verantwortungsvollen Offenlegung. Ihre Erkenntnisse betrafen Interaktionen zwischen Modellen und das Zusammenfassen von Gesprächen. Das Unternehmen untersuchte die beschriebenen Angriffswege und bestätigte deren Existenz. Die Arbeit der Forscher half ihm, diese Angriffsklasse besser zu verstehen, und beschleunigte die Einführung von Schutzmaßnahmen.
Als Sicherheitsrisiko sieht OpenAI die mögliche Nutzung extrahierter Denkprozesse zum Training eines anderen Modells, ohne dabei die Schutzmaßnahmen für die Nutzerausgaben des ursprünglichen Systems zu übernehmen. In großem Maßstab könnte eine solche Destillation nach Einschätzung des Unternehmens den Transfer fortgeschrittener Fähigkeiten beschleunigen, ohne dass entsprechende Investitionen in die Sicherheit damit einhergehen.
Kontensperren und Schutz bei der Ausgabe von Modellantworten
OpenAI ergriff nach eigenen Angaben Maßnahmen gegen Konten, führte technische Kontrollen ein und arbeitete mit weiteren Dienstanbietern zusammen. Das Unternehmen sperrte betrügerische Konten oder schränkte sie ein, verschärfte die Kontrollen bei Registrierungen und in der Infrastruktur und erweiterte die Überwachung verwandter Netzwerke. Lief die Aktivität über Dienste Dritter, arbeitete es mit deren Anbietern zusammen, um die beteiligten Konten zu identifizieren und zu blockieren.
Auf Modellebene hat das Unternehmen nach eigenen Angaben den Schutz verborgener Denkprozesse über Nutzer, Arbeitsbereiche, Organisationen und Modellfamilien hinweg verstärkt. Es schloss außerdem einen Angriffsweg, über den jemand, der bereits verschlüsselte Denkprozesse eines anderen Nutzers besaß, diese erneut einreichen und ihren Inhalt auslesen konnte.
Weitere eingeführte Kontrollen richten sich dem Unternehmen zufolge auf Modellausgaben, die fortlaufend übermittelt werden. Sie sollen Inhalte erkennen und zurückhalten, die geschützte Denkprozesse offenlegen könnten.
Schutzmaßnahmen werden auch auf Partner ausgeweitet
OpenAI teilte nach eigenen Angaben Erkenntnisse über das Frontier Model Forum und geeignete staatliche Kanäle für den Informationsaustausch. Damit sollten andere Entwickler fortgeschrittener Modelle und Partner aus dem öffentlichen Sektor ähnliche Aktivitäten erkennen und ihre eigenen Schutzmaßnahmen verstärken können.
Die Arbeit an den Schutzmaßnahmen geht laut dem Unternehmen auch nach dem Stopp der beschriebenen Kampagne weiter. Bei Partnern betriebene Systeme benötigen denselben Schutz wie die eigenen Dienste; Angriffe über Werkzeugausgaben erfordern zudem Kontrollen, die über gewöhnlichen sichtbaren Text hinausgehen. OpenAI verbessert deshalb weiterhin die Absicherung von Werkzeugen, die Abdeckung durch Klassifikatoren und die Ablehnung von Anfragen durch Modelle und weitet die entsprechenden Kontrollen auf Cloud-Partner aus.



