Nur sechs Wochen nach der Veröffentlichung von GPT-5.4 hat OpenAI bereits eine weitere neue Version herausgebracht. GPT-5.5 ist das bislang leistungsfähigste und intuitivste Modell des Unternehmens. Und diesmal geht es nicht nur um bessere Testergebnisse. Greg Brockman, Mitgründer und Präsident von OpenAI, erklärte bei einem Treffen mit Journalisten, dass GPT-5.5 OpenAI der Entwicklung einer sogenannten Super-App einen Schritt näher bringt. Eines einzigen Programms, das Chat, Programmierassistenz und Browser miteinander vereint.
„Es ist ein schnellerer und schärferer Denker, der mit weniger Tokens mehr bewältigt als etwa 5.4“, sagte Brockman den Journalisten. Dieser Satz ist wichtig. Leistungsfähigere Modelle sind üblicherweise langsamer. GPT-5.5 widersetzt sich diesem Kompromiss. Es erreicht dieselbe Latenz pro Token wie GPT-5.4, obwohl es auf einem deutlich höheren Niveau arbeitet. Zugleich benötigt es für dieselbe Aufgabe weniger Tokens, was für Unternehmen, die künstliche Intelligenz in großem Maßstab einsetzen, niedrigere Kosten bedeutet.
Programmieren mit GPT-5.5 – Fortschritt oder noch immer tabu?
Am stärksten konnte GPT-5.5 im Bereich der autonomen Programmierung punkten. Im Benchmark Terminal-Bench 2.0, der die Fähigkeit misst, komplexe Kommandozeilenaufgaben zu bewältigen und Werkzeuge zu koordinieren, erreichte das Modell 82,7 %. Die vorherige Version GPT-5.4 kam auf 75,1 %. Das Konkurrenzmodell Claude Opus 4.7 von Anthropic erreichte 69,4 % und Gemini 3.1 Pro von Google 68,5 %.
Im internen Test Expert-SWE, dessen Aufgaben einer Arbeit entsprechen, für die ein menschlicher Entwickler durchschnittlich zwanzig Stunden benötigt, erreichte GPT-5.5 73,1 % gegenüber 68,5 % bei GPT-5.4.
Professor Ethan Mollick von der Wharton School, der regelmäßig neue Modelle testet, hatte bereits vor der öffentlichen Veröffentlichung Zugang zu GPT-5.5. In seinem Blog One Useful Thing beschrieb er, dass er seit Jahren über unverarbeitete anonymisierte Daten aus der Crowdfunding-Forschung verfügt. Hunderte Dateien in den Formaten STATA, CSV, XLS und Word, zu deren Bearbeitung er nie gekommen war. Er gab vier Anweisungen ein. Das Modell sortierte die Daten, schlug eine Hypothese vor, überprüfte sie mit ausgefeilten statistischen Methoden und verfasste eine wissenschaftliche Arbeit einschließlich Literaturüberblick und Formatierung.
„Ich wäre sehr zufrieden, wenn dieses Ergebnis aus einem Promotionsprojekt im zweiten Jahr hervorgegangen wäre“, schrieb Mollick. „Und dafür brauchte ich nur vier Anweisungen, ohne den Text selbst anzurühren.“
Gleichzeitig wies er jedoch auf die Grenzen hin. Die Hypothese selbst war nicht besonders interessant, und im Text zeigten sich die für das Schreiben mit künstlicher Intelligenz typischen Probleme. Übertrieben ausgeschmückte Sätze, eintönige Dialoge der Figuren, sich wiederholende Muster. „Die Grenze der Fähigkeiten ist noch immer sichtbar. Sie liegt nur viel weiter entfernt als früher“, fasste Mollick zusammen.
Super-App in Sicht
Hinter den technischen Ergebnissen verbirgt sich eine größere Ambition. Brockman und Sam Altman sprechen offen darüber, ChatGPT, den Programmierassistenten Codex und einen Webbrowser in einer einzigen Anwendung vereinen zu wollen. Ein Werkzeug, das ohne Unterbrechung der Arbeit zwischen Schreiben, Programmieren und Surfen im Internet wechselt.
„Für mich ist das ein echter Schritt hin zu der Art von Computerarbeit, die wir für die Zukunft erwarten“, sagte Brockman. „Aber es ist nur ein Schritt, und wir erwarten noch viele weitere.“ Die Idee einer Super-App ist nicht allein OpenAI vorbehalten. Elon Musk will dasselbe aus dem Netzwerk X machen. Der Kampf darum, wer die universelle KI-gestützte Arbeitsumgebung erschafft, beginnt gerade erst.
Sicherheitsstufe „High“, aber nicht „Critical“
Die Veröffentlichung von GPT-5.5 erfolgte genau zu einem Zeitpunkt, an dem die Sicherheitsfähigkeiten künstlicher Intelligenz verstärkt in den Fokus rücken. Kurz zuvor hatte Anthropic das auf Cybersicherheit ausgerichtete Werkzeug Mythos angekündigt, zu dem Berichten zufolge eine unbefugte Gruppe von Nutzern Zugang erlangte.
OpenAI stufte die Cyberfähigkeiten von GPT-5.5 gemäß seinem eigenen Bereitschaftsrahmen als „High“ ein. Damit sind Fähigkeiten gemeint, die bestehende Wege zu schwerwiegenden Schäden verstärken können. Das Modell erreichte jedoch nicht die Stufe „Critical“, die völlig neue Möglichkeiten zur Verursachung schwerwiegender Schäden bedeuten würde. Im Benchmark CyberGym erreichte es 81,8 % gegenüber 73,1 % bei Claude Opus 4.7.
Mia Glaese, Vizepräsidentin für Forschung bei OpenAI, betonte, dass das Modell umfangreichen Tests durch Teams sowohl für Cyber- als auch für biologische Risiken unterzogen wurde. Zugleich startet OpenAI das Programm „Trusted Access for Cyber“, einen verifizierten Zugang für Verteidiger kritischer Infrastrukturen mit weniger restriktiven Modelleinstellungen.
Verfügbarkeit und Preis
GPT-5.5 steht Nutzern der Tarife Plus, Pro, Business und Enterprise in ChatGPT und Codex zur Verfügung. Die Version GPT-5.5 Pro ist für Nutzer von Pro, Business und Enterprise bestimmt. Das Modell ist auch über die API zugänglich.
Der Preis in der API beträgt 5 Dollar pro Million Eingabe-Tokens und 30 Dollar pro Million Ausgabe-Tokens. Die Version GPT-5.5 Pro kostet 30 Dollar pro Million Eingabe-Tokens und 180 Dollar pro Million Ausgabe-Tokens. In Codex arbeitet das Modell mit einem Kontextfenster von 400.000 Tokens, in der API mit bis zu einer Million.
Jakub Pachocki, leitender Wissenschaftler bei OpenAI, fügte bei der Veröffentlichung hinzu: „Ich sehe kurzfristig ziemlich deutliche Verbesserungen und mittelfristig extrem deutliche. Tatsächlich glaube ich, dass die vergangenen zwei Jahre überraschend langsam waren.“



