Alibaba hat im September das Modell Qwen3-VL vorgestellt und nun einen ausführlichen technischen Bericht zu diesem offenen multimodalen Modell veröffentlicht. Das System zeichnet sich bei Aufgaben aus, bei denen es mathematische Probleme anhand von Bildern löst, und kann stundenlange Videos untersuchen. Es verarbeitet enorme Datenmengen, beispielsweise ein zweistündiges Video oder Hunderte Dokumentseiten in einem Kontextfenster mit einer Größe von 256.000 Token.
In Tests nach dem Prinzip „Nadel im Heuhaufen“ erreichte das größte Modell mit 235 Milliarden Parametern eine hundertprozentige Genauigkeit beim Auffinden einzelner Frames in dreißigminütigen Videos. Selbst bei zweistündigen Videos, die ungefähr eine Million Token enthalten, lag die Genauigkeit weiterhin bei 99,5 %. Der Test funktioniert so, dass ein wichtiger, bedeutungstragender Frame zufällig in ein langes Video eingefügt wird und das System ihn finden und untersuchen muss.
Benchmark-Ergebnisse
In den veröffentlichten Vergleichen übertrifft Qwen3-VL-235B-A22B häufig Modelle wie Gemini 2.5 Pro, OpenAI GPT-5 oder Claude Opus 4.1, selbst wenn die Konkurrenten fortschrittliche Schlussfolgerungsfunktionen oder hohe Denkbudgets nutzen. Visuelle Mathematikaufgaben bewältigt es hervorragend: Im MathVista-Test erreichte es 85,8 %, mehr als die 81,3 % von GPT-5. Bei MathVision führte es mit 74,6 %, vor Gemini 2.5 Pro mit 73,3 % und GPT-5 mit 65,8 %.
Das Modell bewährte sich auch in spezialisierten Tests. Bei DocVQA zum Dokumentverständnis erreichte es 96,5 %, und bei OCRBench zur Texterkennung erzielte es 875 Punkte. Es unterstützt 39 Sprachen, fast viermal so viele wie die vorherige Version. Bei der optischen Zeichenerkennung (OCR) erreichte es in 32 dieser 39 Sprachen eine Genauigkeit von über 70 %.
Fähigkeiten in der Praxis
Alibaba zufolge bringt das System Neuerungen bei Aufgaben mit grafischen Benutzeroberflächen (GUI). Im Test ScreenSpot Pro zur Navigation in grafischen Oberflächen erreichte es eine Genauigkeit von 61,8 %. Bei AndroidWorld, wo es Android-Apps selbstständig bedienen muss, erreichte Qwen3-VL-32B 63,7 %.
Es verarbeitet auch komplexe mehrseitige PDF-Dokumente. Bei MMLongBench-Doc zur Analyse langer Dokumente erreichte es 56,2 %. Im Benchmark CharXiv für wissenschaftliche Diagramme erzielte es 90,5 % bei beschreibenden Aufgaben und 66,2 % bei Fragen, die komplexe Schlussfolgerungen erfordern.
Doch nicht in allen Bereichen liegt es an der Spitze. Im umfassenden Test MMMU-Pro erreichte es 69,3 %, weniger als die 78,4 % von GPT-5. Konkurrenzmodelle liegen bei Fragen und Antworten zu Videos üblicherweise vorn. Qwen3-VL erweist sich somit als Spezialist für visuelle Mathematik und Dokumente, bleibt beim allgemeinen Schlussfolgern jedoch zurück.
Technische Verbesserungen für eine höhere Leistung
Der technische Bericht beschreibt drei wesentliche Änderungen an der Architektur. Die erste ist „interleaved MRoPE“, die die bisherige Positionierungsmethode ersetzt. Statt mathematische Repräsentationen nach Dimensionen (zeitlich, horizontal, vertikal) zu gruppieren, verteilt sie diese nun gleichmäßig auf alle verfügbaren mathematischen Bereiche. Das hilft bei langen Videos.
Die zweite Neuerung ist die DeepStack-Technologie, die dem Modell Zugriff auf Zwischenergebnisse des visuellen Encoders und nicht nur auf dessen finale Ausgabe ermöglicht. Dadurch stehen dem System visuelle Informationen auf unterschiedlichen Detailebenen zur Verfügung.
Die dritte Änderung ist ein textbasiertes Zeitstempelsystem, das das komplexe T-RoPE aus Qwen2.5-VL ersetzt. Statt jedem Videoframe eine mathematische Zeitposition zuzuweisen, fügt das System nun einfache Textmarkierungen wie „<3.8 seconds>“ direkt in die Eingabe ein. Das vereinfacht den Prozess und verbessert das Verständnis zeitbezogener Aufgaben in Videos.
Training in enormem Maßstab
Alibaba trainierte das Modell in vier Phasen auf bis zu 10.000 Grafikprozessoren (GPU). Zunächst lernte es, Bilder und Text miteinander zu verknüpfen, anschließend durchlief es ein vollständiges multimodales Training mit ungefähr einer Billion Token. Zu den Datenquellen gehörten Web-Scrapes, 3 Millionen PDF-Dateien aus Common Crawl und mehr als 60 Millionen Aufgaben aus den MINT-Bereichen.
In späteren Phasen erweiterte das Team das Kontextfenster schrittweise von 8.000 auf 32.000 und schließlich auf 262.000 Token. Die „Thinking“-Varianten erhielten ein spezielles Training mit Gedankenketten, wodurch sie die einzelnen Schlussfolgerungsschritte explizit abbilden können, um bei komplexen Problemen bessere Ergebnisse zu erzielen.
Offenheit und Verfügbarkeit
Alle seit September veröffentlichten Qwen3-VL-Modelle sind unter der Apache-2.0-Lizenz mit offenen Gewichten auf Hugging Face verfügbar. Das Angebot umfasst dichte Varianten mit 2 Milliarden bis 32 Milliarden Parametern sowie Mixture-of-Experts-Modelle: 30B-A3B und das riesige 235B-A22B.
Funktionen wie die Extraktion von Frames aus langen Videos sind nicht neu – Google Gemini 1.5 Pro beherrschte dies bereits Anfang 2024 –, doch Qwen3-VL bietet eine vergleichbare Leistung in einem offenen Paket. Das vorherige Qwen2.5-VL ist in der Forschung weitverbreitet, sodass das neue Modell die offene Entwicklung wahrscheinlich weiter voranbringen wird.
Weitere Quelle: the-decoder.com



