Alibaba Cloud präsentiert Qwen3-VL, eine neue Generation eines offenen multimodalen Modells, das die Verarbeitung von Text und visuellen Inhalten kombiniert. Dieses Modell konzentriert sich auf ein besseres Verständnis von Bildern, Videos und Texten, mit besonderem Schwerpunkt auf längeren Kontexten und agentischen Interaktionen. Das Flaggschiffmodell Qwen3-VL-235B-A22B ist offen verfügbar und wird in den Versionen Instruct und Thinking angeboten. Die Instruct-Version erzielt in wichtigen Benchmarks zur visuellen Wahrnehmung Ergebnisse, die mit Gemini 2.5 Pro vergleichbar oder besser sind, während sich die Thinking-Version durch multimodales Schlussfolgern auszeichnet.

Das Modell Qwen3-VL-235B-A22B-Instruct überzeugt in zehn Dimensionen, darunter Aufgaben auf Universitätsniveau, mathematisches Schlussfolgern, Logikrätsel, allgemeine visuelle Fragestellungen, subjektive Wahrnehmung, Befolgen von Anweisungen, mehrsprachige Texterkennung, Analyse von Diagrammen und Dokumenten, 2D- und 3D-Objektlokalisierung, Verständnis mehrerer Bilder, räumliche Wahrnehmung, Videoverständnis, Ausführung agentischer Aufgaben und Codegenerierung. Bei den meisten dieser Metriken übertrifft es geschlossene Modelle wie Gemini 2.5 Pro und GPT-5 und stellt neue Rekorde unter den offenen multimodalen Modellen auf.

Qwen3-VL-235B-A22B-Thinking ist für MINT (Mathematik, Informatik, Naturwissenschaften und Technik) sowie mathematisches Schlussfolgern optimiert. Bei komplexen Fragen erkennt es feine Details, zerlegt Probleme, analysiert Ursachen und Folgen und liefert logische, durch Belege gestützte Antworten. In Benchmarks wie MathVision, MMMU und MathVista erzielt es starke Ergebnisse und übertrifft in einigen Fällen sogar Gemini 2.5 Pro.

Wesentliche Verbesserungen der Fähigkeiten
Qwen3-VL kann Computer- und mobile Benutzeroberflächen bedienen, Elemente grafischer Benutzeroberflächen (GUI) erkennen, die Funktionen von Schaltflächen verstehen, Werkzeuge aufrufen und Aufgaben ausführen. Im Benchmark OS World erzielt es Spitzenergebnisse, wobei der Einsatz von Werkzeugen die Leistung bei der feingranularen Wahrnehmung verbessert.
Das Modell generiert Code aus Bildern oder Videos und wandelt beispielsweise Design-Mock-ups in die Formate Draw.io, HTML, CSS oder JavaScript um. Dies ermöglicht visuelles Programmieren nach dem Prinzip „Was Sie sehen, ist das, was Sie bekommen“.
Alle Modelle unterstützen nativ einen Kontext von 256K Token, der auf bis zu 1 Million Token erweitert werden kann. Dadurch lassen sich Hunderte Seiten technischer Dokumente, vollständige Lehrbücher oder zweistündige Videos verarbeiten, wobei sich das Modell Details merkt und sie präzise wiederfinden kann – bei Videos sogar sekundengenau.
Die optische Zeichenerkennung (OCR) unterstützt nun 32 Sprachen statt der ursprünglichen 10 und funktioniert unter schwierigen Bedingungen wie schwacher Beleuchtung, Unschärfe oder geneigtem Text zuverlässiger. Die Erkennungsgenauigkeit bei seltenen Zeichen, alten Schriften und Fachbegriffen wurde ebenso verbessert wie das Verständnis langer Dokumente und die Rekonstruktion feiner Strukturen.
Dank des frühen gemeinsamen Vortrainings von Text und visuellen Modalitäten erreicht das Modell Textfähigkeiten, die mit dem Modell Qwen3-235B-A22B-2507 vergleichbar sind. Dadurch wird es zu einem textbasierten multimodalen Modell für die nächste Generation visuell-sprachlicher Systeme.
Architektur und Innovationen
Die Architektur behält das native Design mit dynamischer Auflösung bei, führt jedoch Aktualisierungen in drei Bereichen ein. Die erste ist Interleaved-MRoPE, bei der die Merkmalsdimensionen abwechselnd nach Zeit, Höhe und Breite aufgeteilt werden. Dies gewährleistet eine vollständige Frequenzabdeckung und verbessert das Verständnis langer Videos.
Die zweite Innovation ist die DeepStack-Technologie, die mehrstufige Merkmale aus ViT (Vision Transformer) verbindet und so die Erfassung visueller Details sowie die Genauigkeit der Ausrichtung von Text und Bildern verbessert. Statt visuelle Token nur in eine einzige Schicht einzufügen, werden sie nun in mehrere Schichten des großen Sprachmodells eingebettet, was ein feineres visuelles Verständnis ermöglicht.
Die dritte Verbesserung ist ein Mechanismus zur Ausrichtung von Text und Zeitstempeln, der das ursprüngliche T-RoPE ersetzt. Er verwendet das Eingabeformat „Zeitstempel – Videoframes“, das eine feinere Ausrichtung zeitlicher Informationen und visueller Inhalte ermöglicht. Das Modell unterstützt nativ die Ausgabe in Sekunden oder im Format Stunden:Minuten:Sekunden, wodurch die Genauigkeit bei der Lokalisierung von Handlungen und Ereignissen in Videos steigt.
Leistung in Tests
Im „Nadel-im-Heuhaufen“-Test mit extrem langen Videos erreichte das Modell bei einer Kontextlänge von 256K Token eine Genauigkeit von 100 %. Bei der Erweiterung auf 1M Token, was ungefähr zwei Stunden Video entspricht, blieb die Genauigkeit bei 99,5 %.
Im Test zur mehrsprachigen Texterkennung außerhalb des Chinesischen und Englischen erreichte das Modell in 32 von 39 Sprachen eine Genauigkeit von über 70 %, was eine starke Generalisierungsfähigkeit zeigt.
Qwen3-VL-235B-A22B-Instruct unterstützt bildbasiertes Schlussfolgern unter Einsatz von Werkzeugen. In Tests mit vier Aufgaben zur feingranularen Wahrnehmung und Interaktion zeigte sich eine konsistente Leistungsverbesserung. Dies bestätigt, dass die Kombination aus Bildanalyse und Werkzeugaufrufen die visuellen Fähigkeiten steigert.
Weitere Modelle und Verfügbarkeit
Neben dem Flaggschiffmodell sind Qwen3-VL-4B und Qwen3-VL-8B in den Versionen Instruct und Thinking erhältlich und für kleinere Geräte geeignet. Ebenfalls verfügbar sind Qwen3-VL-30B-A3B-Instruct und Qwen3-VL-30B-A3B-Thinking sowie FP8-Versionen für eine effiziente Bereitstellung.
Die Modelle sind mit Transformers und vLLM kompatibel und unterstützen Quantisierung sowie Beschleunigungstechnologien wie Flash-Attention 2. Für Entwickler stehen Code für das Fine-Tuning und Cookbooks für verschiedene Fähigkeiten zur Verfügung, darunter Omni-Erkennung, Dokumentenanalyse, 2D- und 3D-Lokalisierung, OCR, Videoverständnis und agentische Interaktionen.



