Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
3. 2. 2026
4 Minuten Lesezeit
Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Das Qwen-Team von Alibaba Cloud hat Qwen3-Max-Thinking vorgestellt, ein proprietäres Sprachmodell für komplexe Schlussfolgerungen, das in einer Reihe von Benchmarks führende Modelle wie GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro übertrifft. Das Modell kombiniert eine enorme Anzahl von Parametern mit fortschrittlichen Techniken des maschinellen Lernens und bietet Entwicklern eine kostengünstige Alternative zu westlichen Lösungen.

Architektur auf Basis der Skalierung zur Testzeit

Die zentrale Innovation von Qwen3-Max-Thinking ist eine Technik namens "Test-Time Scaling" (Skalierung zur Testzeit). Im Gegensatz zu Standardmethoden, bei denen das Modell Token linear generiert, nutzt Qwen3 den sogenannten "Heavy Mode" (Schwerlastmodus), der es dem Modell ermöglicht, Rechenleistung gegen Intelligenz einzutauschen. Anstelle des naiven Ansatzes des "Best-of-N Sampling", bei dem das Modell beispielsweise 100 Antworten generiert und die beste auswählt, verwendet Qwen3-Max-Thinking eine Strategie kumulativer Erfahrungen über mehrere Runden. Dieser Ansatz ahmt die menschliche Problemlösung nach. Das Modell nutzt einen proprietären "Take-Experience"-Mechanismus, um Erkenntnisse aus vorherigen Denkschritten zu destillieren. Dadurch kann es Sackgassen erkennen und Rechenleistung auf ungelöste Unklarheiten umleiten.

Die Ergebnisse sind greifbar. Beim Benchmark GPQA (wissenschaftliche Fragen auf Promotionsniveau) verbesserte sich die Punktzahl von 90,3 auf 92,8. Bei LiveCodeBench v6 stieg die Leistung von 88,0 auf 91,4, und das ohne einen proportionalen Anstieg der Token-Kosten.

Adaptive Nutzung von Werkzeugen für praktische Anwendungen

Qwen3-Max-Thinking überbrückt die Kluft zwischen reinem "Denken" und praktischer Nutzung, indem es drei Werkzeuge als grundlegende Fähigkeiten integriert: Websuche, Gedächtnis und Code-Interpreter. Das Modell wählt autonom das richtige Werkzeug für die jeweilige Aufgabe aus, ohne dass der Nutzer dies manuell vorgeben muss. Im "Thinking Mode" kann das Modell diese Werkzeuge gleichzeitig einsetzen. Diese Fähigkeit ist für Unternehmensanwendungen von entscheidender Bedeutung, bei denen das Modell möglicherweise eine Tatsache überprüfen (Suche), eine Prognose berechnen (Code-Interpreter) und anschließend über die strategischen Auswirkungen nachdenken (Denken) muss – alles in einem einzigen Schritt.

Das Qwen-Team stellt empirisch fest, dass diese Kombination "Halluzinationen wirksam reduziert", da das Modell seine Schlussfolgerungen auf überprüfbare externe Daten stützen kann, anstatt sich ausschließlich auf seine Trainingsgewichte zu verlassen.

Benchmark-Tabelle mit Punktzahlen: GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro, DeepSeek V3.2, Qwen3-Max-Thinking.
Benchmark-Tabelle mit Punktzahlen: GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro, DeepSeek V3.2, Qwen3-Max-Thinking.

Benchmark-Ergebnisse

In 19 öffentlichen Benchmarks erreichte Qwen3-Max-Thinking das gleiche oder ein höheres Niveau als GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro. Im Wissenstest erzielte das Modell 85,7 bei MMLU-Pro, 92,8 bei MMLU-Redux und 93,7 bei C-Eval, wo es die Gruppe bei der Bewertung der chinesischen Sprache anführte. Bei anspruchsvollen Schlussfolgerungsaufgaben erzielte es 87,4 bei GPQA, 98,0 bei HMMT Feb 25, 94,7 bei HMMT Nov 25 und 83,9 bei IMOAnswerBench, womit es zur Spitzengruppe der aktuellen mathematischen und wissenschaftlichen Modelle zählt.

Das wichtigste Signal für Entwickler liefert der Benchmark "Humanity's Last Exam" (HLE) – die letzte Prüfung der Menschheit –, der die Leistung anhand von 3.000 Fragen auf Postgraduiertenniveau aus Mathematik, Naturwissenschaften, Informatik, Geisteswissenschaften und Ingenieurwesen misst. Qwen3-Max-Thinking erreichte mit Werkzeugen für die Websuche eine Punktzahl von 49,8 und übertraf damit sowohl Gemini 3 Pro (45,8) als auch GPT-5.2-Thinking (45,5).

Auch bei Programmieraufgaben zeichnet sich das Modell aus. Bei Arena-Hard v2 erreichte es eine Punktzahl von 90,2 und lag damit deutlich vor Konkurrenten wie Claude-Opus-4.5 (76,7).

Kostengünstige Alternative für Entwickler

Alibaba Cloud hat Qwen3-Max-Thinking als Premium-, aber dennoch erschwingliches Angebot positioniert. Die Preise lauten wie folgt:

  • Eingabe: 30 Kč pro 1 Million Token (für Standardkontexte ≤ 32k)
  • Ausgabe: 150 Kč pro 1 Million Token

Diese Preisstruktur ist aggressiv und unterbietet viele ältere Flaggschiffmodelle, während sie gleichzeitig Spitzenleistung bietet. Zum Vergleich: GPT-5.2 kostet ungefähr 44 Kč für die Eingabe und 350 Kč für die Ausgabe pro Million Token, während Claude Opus 4.5 125 Kč für die Eingabe und 625 Kč für die Ausgabe berechnet.

Entwickler sollten die detaillierte Preisgestaltung für die neuen agentischen Fähigkeiten beachten. Alibaba trennt die Kosten für das "Denken" (Token) von den Kosten für das "Handeln" (Werkzeugnutzung):

  • Agent Search Strategy: Sowohl die Standard- als auch die erweiterte Strategie kosten 250 Kč pro 1.000 Aufrufe
  • Web Extractor: Kostenlos (zeitlich begrenztes Angebot)
  • Code Interpreter: Kostenlos (zeitlich begrenztes Angebot)

Kompatibilität mit dem Entwickler-Ökosystem

Alibaba Cloud hat dafür gesorgt, dass Qwen3-Max-Thinking sofort integriert werden kann. Die API unterstützt das Standardformat von OpenAI, sodass Teams allein durch das Ändern von base_url und des model-Namens zwischen Modellen wechseln können. In einem geschickten Schritt zur Erschließung des Programmiermarktes unterstützt die API außerdem das Anthropic-Protokoll, wodurch Qwen3-Max-Thinking mit Claude Code, einer beliebten Umgebung für agentisches Programmieren, kompatibel ist.

Das Modell ist jetzt in Qwen Chat und über Alibaba Cloud Model Studio mit einer OpenAI-kompatiblen HTTP-API verfügbar. Entwickler können nach der Registrierung eines Alibaba-Cloud-Kontos und der Erstellung eines API-Schlüssels mit dem Modell experimentieren.

Quellen: venturebeat.com und marktechpost.com

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok