Das Qwen-Team von Alibaba Cloud hat Qwen3-Max-Thinking vorgestellt, ein proprietäres Sprachmodell für komplexe Schlussfolgerungen, das in einer Reihe von Benchmarks führende Modelle wie GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro übertrifft. Das Modell kombiniert eine enorme Anzahl von Parametern mit fortschrittlichen Techniken des maschinellen Lernens und bietet Entwicklern eine kostengünstige Alternative zu westlichen Lösungen.
Architektur auf Basis der Skalierung zur Testzeit
Die zentrale Innovation von Qwen3-Max-Thinking ist eine Technik namens "Test-Time Scaling" (Skalierung zur Testzeit). Im Gegensatz zu Standardmethoden, bei denen das Modell Token linear generiert, nutzt Qwen3 den sogenannten "Heavy Mode" (Schwerlastmodus), der es dem Modell ermöglicht, Rechenleistung gegen Intelligenz einzutauschen. Anstelle des naiven Ansatzes des "Best-of-N Sampling", bei dem das Modell beispielsweise 100 Antworten generiert und die beste auswählt, verwendet Qwen3-Max-Thinking eine Strategie kumulativer Erfahrungen über mehrere Runden. Dieser Ansatz ahmt die menschliche Problemlösung nach. Das Modell nutzt einen proprietären "Take-Experience"-Mechanismus, um Erkenntnisse aus vorherigen Denkschritten zu destillieren. Dadurch kann es Sackgassen erkennen und Rechenleistung auf ungelöste Unklarheiten umleiten.
Die Ergebnisse sind greifbar. Beim Benchmark GPQA (wissenschaftliche Fragen auf Promotionsniveau) verbesserte sich die Punktzahl von 90,3 auf 92,8. Bei LiveCodeBench v6 stieg die Leistung von 88,0 auf 91,4, und das ohne einen proportionalen Anstieg der Token-Kosten.
Adaptive Nutzung von Werkzeugen für praktische Anwendungen
Qwen3-Max-Thinking überbrückt die Kluft zwischen reinem "Denken" und praktischer Nutzung, indem es drei Werkzeuge als grundlegende Fähigkeiten integriert: Websuche, Gedächtnis und Code-Interpreter. Das Modell wählt autonom das richtige Werkzeug für die jeweilige Aufgabe aus, ohne dass der Nutzer dies manuell vorgeben muss. Im "Thinking Mode" kann das Modell diese Werkzeuge gleichzeitig einsetzen. Diese Fähigkeit ist für Unternehmensanwendungen von entscheidender Bedeutung, bei denen das Modell möglicherweise eine Tatsache überprüfen (Suche), eine Prognose berechnen (Code-Interpreter) und anschließend über die strategischen Auswirkungen nachdenken (Denken) muss – alles in einem einzigen Schritt.
Das Qwen-Team stellt empirisch fest, dass diese Kombination "Halluzinationen wirksam reduziert", da das Modell seine Schlussfolgerungen auf überprüfbare externe Daten stützen kann, anstatt sich ausschließlich auf seine Trainingsgewichte zu verlassen.
Benchmark-Ergebnisse
In 19 öffentlichen Benchmarks erreichte Qwen3-Max-Thinking das gleiche oder ein höheres Niveau als GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro. Im Wissenstest erzielte das Modell 85,7 bei MMLU-Pro, 92,8 bei MMLU-Redux und 93,7 bei C-Eval, wo es die Gruppe bei der Bewertung der chinesischen Sprache anführte. Bei anspruchsvollen Schlussfolgerungsaufgaben erzielte es 87,4 bei GPQA, 98,0 bei HMMT Feb 25, 94,7 bei HMMT Nov 25 und 83,9 bei IMOAnswerBench, womit es zur Spitzengruppe der aktuellen mathematischen und wissenschaftlichen Modelle zählt.
Das wichtigste Signal für Entwickler liefert der Benchmark "Humanity's Last Exam" (HLE) – die letzte Prüfung der Menschheit –, der die Leistung anhand von 3.000 Fragen auf Postgraduiertenniveau aus Mathematik, Naturwissenschaften, Informatik, Geisteswissenschaften und Ingenieurwesen misst. Qwen3-Max-Thinking erreichte mit Werkzeugen für die Websuche eine Punktzahl von 49,8 und übertraf damit sowohl Gemini 3 Pro (45,8) als auch GPT-5.2-Thinking (45,5).
Auch bei Programmieraufgaben zeichnet sich das Modell aus. Bei Arena-Hard v2 erreichte es eine Punktzahl von 90,2 und lag damit deutlich vor Konkurrenten wie Claude-Opus-4.5 (76,7).
Kostengünstige Alternative für Entwickler
Alibaba Cloud hat Qwen3-Max-Thinking als Premium-, aber dennoch erschwingliches Angebot positioniert. Die Preise lauten wie folgt:
- Eingabe: 30 Kč pro 1 Million Token (für Standardkontexte ≤ 32k)
- Ausgabe: 150 Kč pro 1 Million Token
Diese Preisstruktur ist aggressiv und unterbietet viele ältere Flaggschiffmodelle, während sie gleichzeitig Spitzenleistung bietet. Zum Vergleich: GPT-5.2 kostet ungefähr 44 Kč für die Eingabe und 350 Kč für die Ausgabe pro Million Token, während Claude Opus 4.5 125 Kč für die Eingabe und 625 Kč für die Ausgabe berechnet.
Entwickler sollten die detaillierte Preisgestaltung für die neuen agentischen Fähigkeiten beachten. Alibaba trennt die Kosten für das "Denken" (Token) von den Kosten für das "Handeln" (Werkzeugnutzung):
- Agent Search Strategy: Sowohl die Standard- als auch die erweiterte Strategie kosten 250 Kč pro 1.000 Aufrufe
- Web Extractor: Kostenlos (zeitlich begrenztes Angebot)
- Code Interpreter: Kostenlos (zeitlich begrenztes Angebot)
Kompatibilität mit dem Entwickler-Ökosystem
Alibaba Cloud hat dafür gesorgt, dass Qwen3-Max-Thinking sofort integriert werden kann. Die API unterstützt das Standardformat von OpenAI, sodass Teams allein durch das Ändern von base_url und des model-Namens zwischen Modellen wechseln können. In einem geschickten Schritt zur Erschließung des Programmiermarktes unterstützt die API außerdem das Anthropic-Protokoll, wodurch Qwen3-Max-Thinking mit Claude Code, einer beliebten Umgebung für agentisches Programmieren, kompatibel ist.
Das Modell ist jetzt in Qwen Chat und über Alibaba Cloud Model Studio mit einer OpenAI-kompatiblen HTTP-API verfügbar. Entwickler können nach der Registrierung eines Alibaba-Cloud-Kontos und der Erstellung eines API-Schlüssels mit dem Modell experimentieren.
Quellen: venturebeat.com und marktechpost.com



