Das neue Modell Opus 4.5 dominiert beim Programmieren

Das neue Modell Opus 4.5 dominiert beim Programmieren

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
27. 11. 2025
4 Minuten Lesezeit
Das neue Modell Opus 4.5 dominiert beim Programmieren

Was ist Claude Opus 4.5?

Das Unternehmen Anthropic hat gerade sein neuestes Modell für künstliche Intelligenz (KI) namens Claude Opus 4.5 veröffentlicht. Dieses Modell erschien am 24. November 2025 und ist auf mehreren Plattformen verfügbar, darunter die eigenen Anwendungen, die API und große Cloud-Dienste wie Amazon, Google oder Microsoft. Personen, die es getestet haben, berichten, dass Opus 4.5 komplexe Aufgaben ohne unnötige Anleitung bewältigt. Beispielsweise kann es Fehler in komplexen Systemen finden und beheben, an denen frühere Modelle gescheitert sind. Rückmeldungen von Kunden wie dem Team des Unternehmens Replicate zufolge ist Opus 4.5 jetzt zu einem Preis verfügbar, der seinen Einsatz für alltägliche Aufgaben ermöglicht – es kostet 115 Kč pro Million Eingabe-Token und 575 Kč pro Million Ausgabe-Token.

Das Modell wurde so konzipiert, dass es bei realen Aufgaben wie Programmierung, der Arbeit mit Excel-Tabellen oder tiefgehender Recherche besonders gute Leistungen erzielt. In einem internen Test von Anthropic, bei dem Bewerber für Ingenieursstellen eine schwierige Hausaufgabe erhalten, erzielte Opus 4.5 beispielsweise eine höhere Punktzahl als jeder Mensch – und das innerhalb eines Zeitlimits von zwei Stunden. Das bedeutet, dass das Modell technische Herausforderungen schneller und besser bewältigte, auch wenn es natürlich nicht über menschliche Fähigkeiten wie Zusammenarbeit oder langjährige Erfahrung verfügt.

Leistung in Benchmarks

Opus 4.5 überzeugt in Tests, die tatsächliche Programmierfähigkeiten messen. Im Benchmark SWE-bench Verified erreichte es 80,9 %, den höchsten Wert unter allen Modellen. Es schlug auch Konkurrenten wie GPT-5.1 mit 77,9 %, Sonnet 4.5 mit 77,2 %, Gemini 3 Pro mit 76,2 %, Opus 4.1 mit 74,5 % oder GPT-5.1 CodeMax mit 73,3 %. Im mehrsprachigen SWE-bench, bei dem Code in acht Sprachen getestet wird, liegt Opus 4.5 in sieben davon an der Spitze.

Benchmark-Ergebnisse von Opus 4.5
Benchmark-Ergebnisse von Opus 4.5

Im Langzeittest Vending-Bench lief das Modell länger fehlerfrei und erzielte ein um 29 % besseres Ergebnis als Sonnet 4.5. Kunden des Unternehmens Warp berichten, dass Opus 4.5 lange autonome Aufgaben in ihrem Terminal Bench mit 15 % besseren Ergebnissen bewältigt.

In einem Beispiel aus dem Benchmark τ2-bench löste das Modell ein Problem mit einem Flugticket auf kreative Weise: Statt eine Änderung in der Basic Economy Class abzulehnen, schlug es vor, zunächst ein Upgrade der Klasse vorzunehmen und anschließend den Flug zu ändern, was gemäß den Regeln eine legitime Lösung ist.

SWE-bench-Ergebnisse
SWE-bench-Ergebnisse

Sicherheit und Widerstandsfähigkeit

Anthropic hat sich auf Sicherheit konzentriert, und Opus 4.5 ist laut der zugehörigen Systemkarte das am stärksten ausgerichtete Modell, das das Unternehmen bisher veröffentlicht hat. In Tests zu „besorgniserregendem Verhalten“ erzielte es unter den Modellen des Unternehmens den niedrigsten Wert, was weniger Risiken wie die Unterstützung menschlichen Missbrauchs oder unbeabsichtigte Aktionen bedeutet. Das Modell ist widerstandsfähiger gegen Angriffe wie Prompt Injection, bei denen Hacker versuchen, schädliche Anweisungen einzuschleusen – Opus 4.5 erreicht bei der Abwehr eine Erfolgsquote von 92 %, was besser ist als bei anderen Modellen wie GPT-5.1 mit 78 % oder Llama 3.1 mit 65 %.

Dieser Fortschritt macht das Modell für kritische Aufgaben geeignet, bei denen Zuverlässigkeit wichtig ist, etwa im Unternehmensumfeld. Einzelheiten zu allen Tests sind in der Systemkarte von Claude Opus 4.5 zu finden.

Ergebnisse bei der Abwehr von Angriffen
Ergebnisse bei der Abwehr von Angriffen

Neuerungen bei Plattform und Werkzeugen

Zusammen mit Opus 4.5 erscheint ein Update für die Claude Developer Platform. Mit dem neuen Parameter „effort“ lässt sich festlegen, wie viele Token das Modell verwendet – auf mittlerer Stufe erreicht es die gleichen Ergebnisse wie Sonnet 4.5, benötigt dabei jedoch 76 % weniger Ausgabe-Token. Auf hoher Stufe übertrifft es Sonnet 4.5 um 4,3 Prozentpunkte und verwendet gleichzeitig 48 % weniger Token.

Das Modell unterstützt dank automatischer Kontextzusammenfassungen längere Konversationen sowie neue Werkzeuge wie eine Zoomfunktion für die Computernutzung, die eine detaillierte Betrachtung des Bildschirms ermöglicht. In Claude Code steht jetzt der Plan Mode zur Verfügung, in dem das Modell vorab Fragen stellt und einen bearbeitbaren Plan in der Datei plan.md erstellt. Die Claude-Anwendung für Chrome ermöglicht die Arbeit über Browser-Tabs, und Claude für Excel ist jetzt als Beta-Version für mehr Benutzer verfügbar.

Der weiterführende Link beschreibt auch andere Modelle der Claude-4.5-Familie: Sonnet 4.5 eignet sich am besten für komplexe Agenten und Programmieraufgaben und bietet in der Beta-Version ein Kontextfenster von bis zu 1 Million Token. Haiku 4.5 ist das schnellste Modell und bietet eine Leistung nahe Sonnet 4 zu einem Drittel des Preises – 23 Kč pro Million Eingabe-Token und 115 Kč pro Million Ausgabe-Token.

Dieses Modell ist über die API unter der Bezeichnung claude-opus-4-5-20251101 verfügbar, und Anthropic plant weitere Aktualisierungen, um mit der Entwicklung der KI Schritt zu halten. 

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok