Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
4. 12. 2025
4 Minuten Lesezeit
Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Alibaba hat im September das Modell Qwen3-VL vorgestellt und nun einen ausführlichen technischen Bericht zu diesem offenen multimodalen Modell veröffentlicht. Das System zeichnet sich bei Aufgaben aus, bei denen es mathematische Probleme anhand von Bildern löst, und kann stundenlange Videos untersuchen. Es verarbeitet enorme Datenmengen, beispielsweise ein zweistündiges Video oder Hunderte Dokumentseiten in einem Kontextfenster mit einer Größe von 256.000 Token.

In Tests nach dem Prinzip „Nadel im Heuhaufen“ erreichte das größte Modell mit 235 Milliarden Parametern eine hundertprozentige Genauigkeit beim Auffinden einzelner Frames in dreißigminütigen Videos. Selbst bei zweistündigen Videos, die ungefähr eine Million Token enthalten, lag die Genauigkeit weiterhin bei 99,5 %. Der Test funktioniert so, dass ein wichtiger, bedeutungstragender Frame zufällig in ein langes Video eingefügt wird und das System ihn finden und untersuchen muss.

Benchmark-Ergebnisse

In den veröffentlichten Vergleichen übertrifft Qwen3-VL-235B-A22B häufig Modelle wie Gemini 2.5 Pro, OpenAI GPT-5 oder Claude Opus 4.1, selbst wenn die Konkurrenten fortschrittliche Schlussfolgerungsfunktionen oder hohe Denkbudgets nutzen. Visuelle Mathematikaufgaben bewältigt es hervorragend: Im MathVista-Test erreichte es 85,8 %, mehr als die 81,3 % von GPT-5. Bei MathVision führte es mit 74,6 %, vor Gemini 2.5 Pro mit 73,3 % und GPT-5 mit 65,8 %.

Benchmark-Ergebnisse und Konkurrenz
Benchmark-Ergebnisse und Konkurrenz

Das Modell bewährte sich auch in spezialisierten Tests. Bei DocVQA zum Dokumentverständnis erreichte es 96,5 %, und bei OCRBench zur Texterkennung erzielte es 875 Punkte. Es unterstützt 39 Sprachen, fast viermal so viele wie die vorherige Version. Bei der optischen Zeichenerkennung (OCR) erreichte es in 32 dieser 39 Sprachen eine Genauigkeit von über 70 %.

Genauigkeit nach Sprache
Genauigkeit nach Sprache

Fähigkeiten in der Praxis

Alibaba zufolge bringt das System Neuerungen bei Aufgaben mit grafischen Benutzeroberflächen (GUI). Im Test ScreenSpot Pro zur Navigation in grafischen Oberflächen erreichte es eine Genauigkeit von 61,8 %. Bei AndroidWorld, wo es Android-Apps selbstständig bedienen muss, erreichte Qwen3-VL-32B 63,7 %.

Es verarbeitet auch komplexe mehrseitige PDF-Dokumente. Bei MMLongBench-Doc zur Analyse langer Dokumente erreichte es 56,2 %. Im Benchmark CharXiv für wissenschaftliche Diagramme erzielte es 90,5 % bei beschreibenden Aufgaben und 66,2 % bei Fragen, die komplexe Schlussfolgerungen erfordern.

Doch nicht in allen Bereichen liegt es an der Spitze. Im umfassenden Test MMMU-Pro erreichte es 69,3 %, weniger als die 78,4 % von GPT-5. Konkurrenzmodelle liegen bei Fragen und Antworten zu Videos üblicherweise vorn. Qwen3-VL erweist sich somit als Spezialist für visuelle Mathematik und Dokumente, bleibt beim allgemeinen Schlussfolgern jedoch zurück.

Technische Verbesserungen für eine höhere Leistung

Der technische Bericht beschreibt drei wesentliche Änderungen an der Architektur. Die erste ist „interleaved MRoPE“, die die bisherige Positionierungsmethode ersetzt. Statt mathematische Repräsentationen nach Dimensionen (zeitlich, horizontal, vertikal) zu gruppieren, verteilt sie diese nun gleichmäßig auf alle verfügbaren mathematischen Bereiche. Das hilft bei langen Videos.

Die zweite Neuerung ist die DeepStack-Technologie, die dem Modell Zugriff auf Zwischenergebnisse des visuellen Encoders und nicht nur auf dessen finale Ausgabe ermöglicht. Dadurch stehen dem System visuelle Informationen auf unterschiedlichen Detailebenen zur Verfügung.

Die dritte Änderung ist ein textbasiertes Zeitstempelsystem, das das komplexe T-RoPE aus Qwen2.5-VL ersetzt. Statt jedem Videoframe eine mathematische Zeitposition zuzuweisen, fügt das System nun einfache Textmarkierungen wie „<3.8 seconds>“ direkt in die Eingabe ein. Das vereinfacht den Prozess und verbessert das Verständnis zeitbezogener Aufgaben in Videos.

Training in enormem Maßstab

Alibaba trainierte das Modell in vier Phasen auf bis zu 10.000 Grafikprozessoren (GPU). Zunächst lernte es, Bilder und Text miteinander zu verknüpfen, anschließend durchlief es ein vollständiges multimodales Training mit ungefähr einer Billion Token. Zu den Datenquellen gehörten Web-Scrapes, 3 Millionen PDF-Dateien aus Common Crawl und mehr als 60 Millionen Aufgaben aus den MINT-Bereichen.

In späteren Phasen erweiterte das Team das Kontextfenster schrittweise von 8.000 auf 32.000 und schließlich auf 262.000 Token. Die „Thinking“-Varianten erhielten ein spezielles Training mit Gedankenketten, wodurch sie die einzelnen Schlussfolgerungsschritte explizit abbilden können, um bei komplexen Problemen bessere Ergebnisse zu erzielen.

Offenheit und Verfügbarkeit

Alle seit September veröffentlichten Qwen3-VL-Modelle sind unter der Apache-2.0-Lizenz mit offenen Gewichten auf Hugging Face verfügbar. Das Angebot umfasst dichte Varianten mit 2 Milliarden bis 32 Milliarden Parametern sowie Mixture-of-Experts-Modelle: 30B-A3B und das riesige 235B-A22B.

Funktionen wie die Extraktion von Frames aus langen Videos sind nicht neu – Google Gemini 1.5 Pro beherrschte dies bereits Anfang 2024 –, doch Qwen3-VL bietet eine vergleichbare Leistung in einem offenen Paket. Das vorherige Qwen2.5-VL ist in der Forschung weitverbreitet, sodass das neue Modell die offene Entwicklung wahrscheinlich weiter voranbringen wird.

Weitere Quelle: the-decoder.com

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok