Qwen3-235B-A22B-Instruct-2507: Das riesige KI-Modell, das Open-Source-Modelle dominiert

Qwen3-235B-A22B-Instruct-2507: Das riesige KI-Modell, das Open-Source-Modelle dominiert

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
23. 7. 2025
5 Minuten Lesezeit
Qwen3-235B-A22B-Instruct-2507: Das riesige KI-Modell, das Open-Source-Modelle dominiert

Qwen3-235B-A22B-Instruct-2507: Ein riesiges KI-Modell, das die Open-Source-Modelle dominiert

Ein neues Sprachmodell, das Unterhaltungen in Dutzenden Sprachen bewältigt, komplexe mathematische Probleme löst und sogar Tools wie ein Profi bedient – und das alles mit erstaunlicher Effizienz. Genau das ist Qwen3-235B-A22B-Instruct-2507, eine im Juli 2025 veröffentlichte Neuheit des Qwen-Teams von Alibaba. Dieses Modell wurde speziell für instruktionale Aufgaben entwickelt und zeichnet sich durch logisches Denken, Textverständnis, Mathematik, Wissenschaft, Programmierung und den Einsatz von Tools aus. Darüber hinaus gibt es auch eine optimierte Version mit FP8-Quantisierung, die Speicher spart und Berechnungen beschleunigt. Sehen wir uns das Schritt für Schritt genauer an, um zu verstehen, warum dieses Modell so ein großer Erfolg ist.

Modellübersicht: Was steckt unter der Haube?

Qwen3-235B-A22B-Instruct-2507 ist ein kausales Sprachmodell (Causal Language Model), das auf der Mixture-of-Experts-Architektur (kurz MoE) basiert. Insgesamt verfügt es über 235 Milliarden Parameter, bei jeder Berechnung werden jedoch nur 22 Milliarden davon aktiviert – konkret kommen von 128 Experten jeweils 8 zum Einsatz. Dies gewährleistet eine hohe Kapazität ohne unnötige Verschwendung von Rechenleistung. Das Modell besitzt 94 Schichten, 64 Attention-Heads für Abfragen (Q) und 4 für Schlüssel und Werte (KV), ermöglicht durch Grouped Query Attention (GQA).

Einer der größten Vorteile ist die native Unterstützung einer Kontextlänge von bis zu 262 144 Token. Das bedeutet, dass das Modell wirklich lange Texte verarbeiten kann – ideal für die Analyse von Dokumenten oder komplexe Gespräche. Dieses Modell ist eine verbesserte Version des vorherigen Qwen3-235B-A22B im nicht denkenden Modus (Non-Thinking Mode), was bedeutet, dass es in seinen Antworten keine Gedankenblöcke erzeugt. Stattdessen konzentriert es sich auf direkte, nützliche Ausgaben. Die Version mit FP8-Quantisierung (Qwen3-235B-A22B-Instruct-2507-FP8) verwendet eine feinkörnige Quantisierung mit einer Blockgröße von 128, wodurch die Hardwareanforderungen sinken – für die Inferenz genügen beispielsweise weniger GPUs, etwa 4 für die Tensorparallelisierung.

Das Modell wurde einem Vortraining und Nachtraining unterzogen, wodurch es über starke Fähigkeiten beim Befolgen von Anweisungen, beim logischen Denken und beim Textverständnis verfügt. Laut den offiziellen Angaben auf Hugging Face bietet es deutliche Verbesserungen bei der Abdeckung seltenen Wissens (Long-Tail Knowledge) in zahlreichen Sprachen, eine bessere Ausrichtung an den Präferenzen der Nutzer und eine hochwertigere Textgenerierung für offene Aufgaben.

Qwen3-235B-A22BInstruct-2507 Benchmarks

Leistung und Vergleich: Die Zahlen sprechen für sich

Was die Leistung betrifft, übertrifft Qwen3-235B-A22B-Instruct-2507 viele Konkurrenten in wichtigen Benchmarks. Im MMLU-Pro-Test erreichte es beispielsweise eine Punktzahl von 83,0 und schnitt damit besser ab als Deepseek-V3-0324 (81,2) oder GPT-4o-0327 (79,8). Bei GPQA (Google Proof Questions and Answers) erreicht es 77,5 Punkte und liegt damit vor Claude Opus 4 Non-thinking (74,9) an der Spitze. In mathematischen Tests wie AIME25 erzielte es beachtliche 70,3 Punkte, während es bei HMMT25 auf 55,4 kam – beides Spitzenwerte im Vergleich zu anderen Modellen.

Beim Programmieren überzeugt es mit 51,8 Punkten in LiveCodeBench v6 (für den Zeitraum von Februar bis Mai 2025) und übertrifft damit Kimi K2 (48,9). Bei agentenbasierten Aufgaben erreicht es 70,9 Punkte in BFCL-v3, 71,3 in TAU-Retail und 44,0 in TAU-Airline. Auch die mehrsprachigen Fähigkeiten liegen auf hohem Niveau: In MMLU-ProX erzielte es 79,4 und in PolyMATH 50,2, was die Unterstützung von mehr als 100 Sprachen und Dialekten belegt.

Die FP8-Version bietet die gleiche Leistung, stellt jedoch geringere Anforderungen – für den Betrieb wird beispielsweise weniger Rechenleistung benötigt, was ideal für kleinere Server ist. Laut Benchmarks aus dem Qwen-Blog und von GitHub hat das Modell das Verständnis langer Kontexte von bis zu 256K Token deutlich verbessert, wodurch es sich für komplexe Szenarien wie die Analyse umfangreicher Dokumente oder mehrsprachige Gespräche eignet.

Qwen3-235B-A22BInstruct-2507 Benchmark-Ergebnisse im Vergleich zur Konkurrenz

Nutzung und Bereitstellung: Wie lässt es sich in der Praxis ausführen?

Wenn Sie das Modell ausprobieren möchten, ist dies dank der Integration mit Tools wie Hugging Face Transformers (Version 4.51.0 und höher) ganz einfach. Ein Python-Codebeispiel zeigt, wie das Modell und der Tokenizer geladen, die Eingabe vorbereitet und eine Antwort generiert werden – für den Prompt „Gib mir eine kurze Einführung in große Sprachmodelle“ erzeugt das Modell beispielsweise einen Text mit bis zu 16 384 neuen Token. Für die Bereitstellung werden SGLang (Version 0.4.6.post1) oder vLLM (0.8.5) empfohlen. Damit können Sie einen Server mit Tensorparallelisierung auf 8 GPUs für die vollständige Kontextlänge von 262 144 Token ausführen. Falls Speicherprobleme auftreten, reduzieren Sie sie auf 32 768.

Für den agentenbasierten Einsatz (Agentic Use) eignet sich Qwen-Agent ideal, da es den Aufruf von Tools vereinfacht – beispielsweise die Integration mit MCP-Konfigurationen für Zeit- oder Fetch-Operationen. Das Modell wird auch von lokalen Anwendungen wie Ollama, LM Studio oder llama.cpp unterstützt. Empfohlene Parameter für die Generierung: Temperatur 0,7, TopP 0,8, TopK 20 und MinP 0. Für Mathematik fügen Sie dem Prompt „Bitte denke Schritt für Schritt nach und setze die endgültige Antwort in \boxed{}.“ hinzu.

Was sagt die Community?

Aus Internetquellen wie GitHub QwenLM/Qwen3 und dem Qwen-Blog geht hervor, dass das Modell öffentlich verfügbar ist und seine Gewichte heruntergeladen werden können, einschließlich GGUF-Formaten für eine einfache Integration. Die Community auf OpenRouter und LM Studio lobt seine Geschwindigkeit und Genauigkeit in realen Anwendungen wie der Codegenerierung oder mehrsprachigen Aufgaben. Es gibt auch quantisierte Varianten, etwa eine 4-Bit-Version für MLX, was den Einsatz auf weniger leistungsfähiger Hardware erleichtert. Laut dem arXiv-Bericht (2505.09388) des Qwen-Teams bietet das Modell eine deutliche Verbesserung bei der Ausrichtung an den Präferenzen der Nutzer, was zu nützlicheren Antworten ohne unnötige Wiederholungen führt – dafür muss presence_penalty lediglich auf einen Wert zwischen 0 und 2 eingestellt werden.

Dieses Modell ist nicht nur eine technische Meisterleistung, sondern ein echter Helfer für Entwickler, Wissenschaftler und gewöhnliche Nutzer. Wenn Sie nach einer KI suchen, die komplexe Aufgaben mit Leichtigkeit bewältigt, ist Qwen3-235B-A22B-Instruct-2507 die richtige Wahl. Probieren Sie es einfach aus und überzeugen Sie sich selbst!

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok