Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
3. 2. 2026
4 Minuten Lesezeit · 3 Aufrufe
Alibaba stellt Qwen3-Max-Thinking vor, das großen Modellen dicht auf den Fersen ist

Das Qwen-Team von Alibaba Cloud hat Qwen3-Max-Thinking vorgestellt, ein proprietäres Sprachmodell für komplexe Schlussfolgerungen, das in einer Reihe von Benchmarks führende Modelle wie GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro übertrifft. Das Modell kombiniert eine enorme Anzahl von Parametern mit fortschrittlichen Techniken des maschinellen Lernens und bietet Entwicklern eine kostengünstige Alternative zu westlichen Lösungen.

Architektur auf Basis der Skalierung zur Testzeit

Die zentrale Innovation von Qwen3-Max-Thinking ist eine Technik namens "Test-Time Scaling" (Skalierung zur Testzeit). Im Gegensatz zu Standardmethoden, bei denen das Modell Token linear generiert, nutzt Qwen3 den sogenannten "Heavy Mode" (Schwerlastmodus), der es dem Modell ermöglicht, Rechenleistung gegen Intelligenz einzutauschen. Anstelle des naiven Ansatzes des "Best-of-N Sampling", bei dem das Modell beispielsweise 100 Antworten generiert und die beste auswählt, verwendet Qwen3-Max-Thinking eine Strategie kumulativer Erfahrungen über mehrere Runden. Dieser Ansatz ahmt die menschliche Problemlösung nach. Das Modell nutzt einen proprietären "Take-Experience"-Mechanismus, um Erkenntnisse aus vorherigen Denkschritten zu destillieren. Dadurch kann es Sackgassen erkennen und Rechenleistung auf ungelöste Unklarheiten umleiten.

Die Ergebnisse sind greifbar. Beim Benchmark GPQA (wissenschaftliche Fragen auf Promotionsniveau) verbesserte sich die Punktzahl von 90,3 auf 92,8. Bei LiveCodeBench v6 stieg die Leistung von 88,0 auf 91,4, und das ohne einen proportionalen Anstieg der Token-Kosten.

Adaptive Nutzung von Werkzeugen für praktische Anwendungen

Qwen3-Max-Thinking überbrückt die Kluft zwischen reinem "Denken" und praktischer Nutzung, indem es drei Werkzeuge als grundlegende Fähigkeiten integriert: Websuche, Gedächtnis und Code-Interpreter. Das Modell wählt autonom das richtige Werkzeug für die jeweilige Aufgabe aus, ohne dass der Nutzer dies manuell vorgeben muss. Im "Thinking Mode" kann das Modell diese Werkzeuge gleichzeitig einsetzen. Diese Fähigkeit ist für Unternehmensanwendungen von entscheidender Bedeutung, bei denen das Modell möglicherweise eine Tatsache überprüfen (Suche), eine Prognose berechnen (Code-Interpreter) und anschließend über die strategischen Auswirkungen nachdenken (Denken) muss – alles in einem einzigen Schritt.

Das Qwen-Team stellt empirisch fest, dass diese Kombination "Halluzinationen wirksam reduziert", da das Modell seine Schlussfolgerungen auf überprüfbare externe Daten stützen kann, anstatt sich ausschließlich auf seine Trainingsgewichte zu verlassen.

Benchmark-Tabelle mit Punktzahlen: GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro, DeepSeek V3.2, Qwen3-Max-Thinking.
Benchmark-Tabelle mit Punktzahlen: GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro, DeepSeek V3.2, Qwen3-Max-Thinking.

Benchmark-Ergebnisse

In 19 öffentlichen Benchmarks erreichte Qwen3-Max-Thinking das gleiche oder ein höheres Niveau als GPT-5.2-Thinking, Claude-Opus-4.5 und Gemini 3 Pro. Im Wissenstest erzielte das Modell 85,7 bei MMLU-Pro, 92,8 bei MMLU-Redux und 93,7 bei C-Eval, wo es die Gruppe bei der Bewertung der chinesischen Sprache anführte. Bei anspruchsvollen Schlussfolgerungsaufgaben erzielte es 87,4 bei GPQA, 98,0 bei HMMT Feb 25, 94,7 bei HMMT Nov 25 und 83,9 bei IMOAnswerBench, womit es zur Spitzengruppe der aktuellen mathematischen und wissenschaftlichen Modelle zählt.

Das wichtigste Signal für Entwickler liefert der Benchmark "Humanity's Last Exam" (HLE) – die letzte Prüfung der Menschheit –, der die Leistung anhand von 3.000 Fragen auf Postgraduiertenniveau aus Mathematik, Naturwissenschaften, Informatik, Geisteswissenschaften und Ingenieurwesen misst. Qwen3-Max-Thinking erreichte mit Werkzeugen für die Websuche eine Punktzahl von 49,8 und übertraf damit sowohl Gemini 3 Pro (45,8) als auch GPT-5.2-Thinking (45,5).

Auch bei Programmieraufgaben zeichnet sich das Modell aus. Bei Arena-Hard v2 erreichte es eine Punktzahl von 90,2 und lag damit deutlich vor Konkurrenten wie Claude-Opus-4.5 (76,7).

Kostengünstige Alternative für Entwickler

Alibaba Cloud hat Qwen3-Max-Thinking als Premium-, aber dennoch erschwingliches Angebot positioniert. Die Preise lauten wie folgt:

  • Eingabe: 30 Kč pro 1 Million Token (für Standardkontexte ≤ 32k)
  • Ausgabe: 150 Kč pro 1 Million Token

Diese Preisstruktur ist aggressiv und unterbietet viele ältere Flaggschiffmodelle, während sie gleichzeitig Spitzenleistung bietet. Zum Vergleich: GPT-5.2 kostet ungefähr 44 Kč für die Eingabe und 350 Kč für die Ausgabe pro Million Token, während Claude Opus 4.5 125 Kč für die Eingabe und 625 Kč für die Ausgabe berechnet.

Entwickler sollten die detaillierte Preisgestaltung für die neuen agentischen Fähigkeiten beachten. Alibaba trennt die Kosten für das "Denken" (Token) von den Kosten für das "Handeln" (Werkzeugnutzung):

  • Agent Search Strategy: Sowohl die Standard- als auch die erweiterte Strategie kosten 250 Kč pro 1.000 Aufrufe
  • Web Extractor: Kostenlos (zeitlich begrenztes Angebot)
  • Code Interpreter: Kostenlos (zeitlich begrenztes Angebot)

Kompatibilität mit dem Entwickler-Ökosystem

Alibaba Cloud hat dafür gesorgt, dass Qwen3-Max-Thinking sofort integriert werden kann. Die API unterstützt das Standardformat von OpenAI, sodass Teams allein durch das Ändern von base_url und des model-Namens zwischen Modellen wechseln können. In einem geschickten Schritt zur Erschließung des Programmiermarktes unterstützt die API außerdem das Anthropic-Protokoll, wodurch Qwen3-Max-Thinking mit Claude Code, einer beliebten Umgebung für agentisches Programmieren, kompatibel ist.

Das Modell ist jetzt in Qwen Chat und über Alibaba Cloud Model Studio mit einer OpenAI-kompatiblen HTTP-API verfügbar. Entwickler können nach der Registrierung eines Alibaba-Cloud-Kontos und der Erstellung eines API-Schlüssels mit dem Modell experimentieren.

Quellen: venturebeat.com und marktechpost.com

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
ChatGPT erhält Space für die Teamarbeit mit KI-AgentenChatGPT erhält Space für die Teamarbeit mit KI-Agenten
OpenAI erweitert ChatGPT um den gemeinsamen Arbeitsraum Space und den Dokumenteditor Pages. Präsentationen sollen sich ebenfalls im Chat erstellen und gemeinsam bearbeiten lassen; Slides soll in den kommenden Wochen folgen.
1 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok