OpenAI hat GPT‑6.1 Sol als Nachfolger von GPT‑6 Sol veröffentlicht. Nach Angaben des Unternehmens verbessert das Modell die Bearbeitung von Softwareaufgaben und mehrstufigen Arbeitsabläufen und nähert sich bei agentischer Programmierung, Computerbedienung und fachlicher Arbeit GPT‑6 Astra an. Verfügbar ist die neue Version in ChatGPT Work, Codex und über die API.
Programmierung und Arbeit mit komplexen PDF-Dokumenten
Bei der Softwareentwicklung stützt OpenAI den Vergleich auf DeepSWE v1.1. Dieser Benchmark bewertet komplexe Entwicklungsaufgaben in realen Code-Repositorien und damit die Arbeit an bestehenden Softwareprojekten. Laut Unternehmen erreicht GPT‑6.1 Sol hier das Ergebnis von GPT‑6 Astra. Gegenüber dem besten Ergebnis von GPT‑6 Sol beträgt der Vorsprung 6,4 Prozentpunkte, obwohl die neue Version mit einer niedrigeren Einstellung für den Reasoning-Aufwand getestet wurde.
Für fachliche Arbeit mit Dokumenten nennt OpenAI GDP.pdf. Dabei müssen Modelle Fachfragen anhand komplexer PDF-Dateien beantworten; zu den relevanten Inhalten gehören Tabellen, Grafiken, Diagramme und kleingedruckte Details. Nach Angaben des Unternehmens erzielt Sol über die getesteten Reasoning-Einstellungen hinweg höhere Werte als Opus 5.5 mit Fallbacks. In diesem Test nähert sich das neue Modell außerdem der Leistung von GPT‑6 Astra an.
Geschäftsprozesse mit Werkzeugen und Computerbedienung
AutomationBench richtet den Blick auf Agenten, die mehrstufige Geschäftsprozesse korrekt abschließen sollen. In Version 1.0.6 umfasst der Test durchgängige Arbeitsabläufe mit 47 Werkzeugen aus Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen. Bei mittlerem Reasoning-Aufwand meldet OpenAI für GPT‑6.1 Sol einen Vorsprung von 2,2 Prozentpunkten gegenüber Opus 5.5. Im Vergleich mit GPT‑6 Sol beträgt die Verbesserung bei derselben Einstellung 4,8 Prozentpunkte.
OpenAI prüft die Computerbedienung anhand der Offline-Sammlung von OSWorld 2.0. Die Aufgaben umfassen länger angelegte Abläufe aus dem Alltag und dem beruflichen Umfeld. Bei maximalem Reasoning-Aufwand liegt GPT‑6.1 Sol laut Unternehmen sieben Prozentpunkte vor GPT‑6 Sol, aber weiterhin 2,1 Prozentpunkte hinter GPT‑6 Astra bei dessen maximaler Einstellung. Als Messwert dient der sogenannte Partial Reward, eine Teilbewertung aus der Offline-Sammlung der Veröffentlichung v2026.08.08.
Bei wissenschaftlichen Aufgaben bleibt Astra vorn
Für wissenschaftliche Arbeitsabläufe führt OpenAI Terminal-Bench Science 0.1 an. Zu den geprüften Aufgaben zählen Datenanalyse, Simulationen und das Beweisen mathematischer Sätze. Bei maximalem Reasoning-Aufwand erreicht GPT‑6.1 Sol nach Angaben des Unternehmens mehr als das Doppelte des Ergebnisses von GPT‑6 Sol. Den höchsten Wert unter den getesteten Modellen erzielt dennoch GPT‑6 Astra mit 68,1 Prozent.
Faktische Fehler und der Umgang mit defekten Suchwerkzeugen
OpenAI berichtet auch über einen Test zur faktischen Richtigkeit. Die Grundlage waren Gespräche ohne identifizierende Angaben, in denen Nutzer zuvor auf einen Fehler eines Modells hingewiesen hatten. Diese bewusst schwierige Auswahl ist nicht repräsentativ für die gewöhnliche Nutzung. Gemessen wurde der Anteil der Antworten mit mindestens einem sachlichen Fehler. Bei niedrigem Reasoning-Aufwand sank dieser Anteil von 11,4 Prozent bei GPT‑6 Sol auf 7,7 Prozent bei GPT‑6.1 Sol.
Ein weiterer Sicherheitstest prüfte, ob Agenten Nutzer über ein defektes Suchwerkzeug informieren, statt eine bestmögliche Vermutung auszugeben. Die Aufgaben waren gezielt auf mögliche Fehler ausgerichtet und bildeten keine gewöhnliche Nutzung ab. Bei maximalem Reasoning-Aufwand unterließ GPT‑6.1 Sol diese Mitteilung laut OpenAI in 2,1 Prozent der Fälle. Für GPT‑6 Sol betrug der Wert 4,9 Prozent, für GPT‑6 Astra 1,5 Prozent.
Zugang über Work, Codex und API; Ultrafast ist geplant
GPT‑6.1 Sol steht Nutzern der Tarife Plus, Pro, Business, Enterprise und Edu in ChatGPT Work und Codex zur Verfügung. Entwickler können das Modell außerdem über die OpenAI-API unter der Kennung gpt-6.1-sol ansprechen. Im Bereich Chat ist es bislang nicht verfügbar.
Die Standardpreise der API betragen je Million Tokens 2 US-Dollar für Eingaben, 0,10 US-Dollar für Eingaben aus dem Cache und 10 US-Dollar für Ausgaben. Die regulären Eingabe- und Ausgabetarife liegen damit bei einem Fünftel der entsprechenden Standardpreise von GPT‑6 Astra. Laut OpenAI ist der Cache-Eingabepreis zudem 95 Prozent niedriger als der reguläre Eingabepreis und 50 Prozent niedriger als bei GPT‑6 Sol. Diesen Vorteil hebt das Unternehmen für Entwickler von Agenten hervor, die denselben Kontext über mehrere Anfragen hinweg wiederverwenden.
Für die folgenden Tage plant OpenAI zusätzlich GPT‑6.1 Sol Ultrafast. Diese Variante soll in Codex nach Angaben des Unternehmens Tokens bis zu achtmal schneller erzeugen als die Standardvariante.



