Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
4. 12. 2025
4 Minuten Lesezeit · 4 Aufrufe
Alibabas offenes Modell verarbeitet stundenlange Videos mit 99,5 % Genauigkeit

Alibaba hat im September das Modell Qwen3-VL vorgestellt und nun einen ausführlichen technischen Bericht zu diesem offenen multimodalen Modell veröffentlicht. Das System zeichnet sich bei Aufgaben aus, bei denen es mathematische Probleme anhand von Bildern löst, und kann stundenlange Videos untersuchen. Es verarbeitet enorme Datenmengen, beispielsweise ein zweistündiges Video oder Hunderte Dokumentseiten in einem Kontextfenster mit einer Größe von 256.000 Token.

In Tests nach dem Prinzip „Nadel im Heuhaufen“ erreichte das größte Modell mit 235 Milliarden Parametern eine hundertprozentige Genauigkeit beim Auffinden einzelner Frames in dreißigminütigen Videos. Selbst bei zweistündigen Videos, die ungefähr eine Million Token enthalten, lag die Genauigkeit weiterhin bei 99,5 %. Der Test funktioniert so, dass ein wichtiger, bedeutungstragender Frame zufällig in ein langes Video eingefügt wird und das System ihn finden und untersuchen muss.

Benchmark-Ergebnisse

In den veröffentlichten Vergleichen übertrifft Qwen3-VL-235B-A22B häufig Modelle wie Gemini 2.5 Pro, OpenAI GPT-5 oder Claude Opus 4.1, selbst wenn die Konkurrenten fortschrittliche Schlussfolgerungsfunktionen oder hohe Denkbudgets nutzen. Visuelle Mathematikaufgaben bewältigt es hervorragend: Im MathVista-Test erreichte es 85,8 %, mehr als die 81,3 % von GPT-5. Bei MathVision führte es mit 74,6 %, vor Gemini 2.5 Pro mit 73,3 % und GPT-5 mit 65,8 %.

Benchmark-Ergebnisse und Konkurrenz
Benchmark-Ergebnisse und Konkurrenz

Das Modell bewährte sich auch in spezialisierten Tests. Bei DocVQA zum Dokumentverständnis erreichte es 96,5 %, und bei OCRBench zur Texterkennung erzielte es 875 Punkte. Es unterstützt 39 Sprachen, fast viermal so viele wie die vorherige Version. Bei der optischen Zeichenerkennung (OCR) erreichte es in 32 dieser 39 Sprachen eine Genauigkeit von über 70 %.

Genauigkeit nach Sprache
Genauigkeit nach Sprache

Fähigkeiten in der Praxis

Alibaba zufolge bringt das System Neuerungen bei Aufgaben mit grafischen Benutzeroberflächen (GUI). Im Test ScreenSpot Pro zur Navigation in grafischen Oberflächen erreichte es eine Genauigkeit von 61,8 %. Bei AndroidWorld, wo es Android-Apps selbstständig bedienen muss, erreichte Qwen3-VL-32B 63,7 %.

Es verarbeitet auch komplexe mehrseitige PDF-Dokumente. Bei MMLongBench-Doc zur Analyse langer Dokumente erreichte es 56,2 %. Im Benchmark CharXiv für wissenschaftliche Diagramme erzielte es 90,5 % bei beschreibenden Aufgaben und 66,2 % bei Fragen, die komplexe Schlussfolgerungen erfordern.

Doch nicht in allen Bereichen liegt es an der Spitze. Im umfassenden Test MMMU-Pro erreichte es 69,3 %, weniger als die 78,4 % von GPT-5. Konkurrenzmodelle liegen bei Fragen und Antworten zu Videos üblicherweise vorn. Qwen3-VL erweist sich somit als Spezialist für visuelle Mathematik und Dokumente, bleibt beim allgemeinen Schlussfolgern jedoch zurück.

Technische Verbesserungen für eine höhere Leistung

Der technische Bericht beschreibt drei wesentliche Änderungen an der Architektur. Die erste ist „interleaved MRoPE“, die die bisherige Positionierungsmethode ersetzt. Statt mathematische Repräsentationen nach Dimensionen (zeitlich, horizontal, vertikal) zu gruppieren, verteilt sie diese nun gleichmäßig auf alle verfügbaren mathematischen Bereiche. Das hilft bei langen Videos.

Die zweite Neuerung ist die DeepStack-Technologie, die dem Modell Zugriff auf Zwischenergebnisse des visuellen Encoders und nicht nur auf dessen finale Ausgabe ermöglicht. Dadurch stehen dem System visuelle Informationen auf unterschiedlichen Detailebenen zur Verfügung.

Die dritte Änderung ist ein textbasiertes Zeitstempelsystem, das das komplexe T-RoPE aus Qwen2.5-VL ersetzt. Statt jedem Videoframe eine mathematische Zeitposition zuzuweisen, fügt das System nun einfache Textmarkierungen wie „<3.8 seconds>“ direkt in die Eingabe ein. Das vereinfacht den Prozess und verbessert das Verständnis zeitbezogener Aufgaben in Videos.

Training in enormem Maßstab

Alibaba trainierte das Modell in vier Phasen auf bis zu 10.000 Grafikprozessoren (GPU). Zunächst lernte es, Bilder und Text miteinander zu verknüpfen, anschließend durchlief es ein vollständiges multimodales Training mit ungefähr einer Billion Token. Zu den Datenquellen gehörten Web-Scrapes, 3 Millionen PDF-Dateien aus Common Crawl und mehr als 60 Millionen Aufgaben aus den MINT-Bereichen.

In späteren Phasen erweiterte das Team das Kontextfenster schrittweise von 8.000 auf 32.000 und schließlich auf 262.000 Token. Die „Thinking“-Varianten erhielten ein spezielles Training mit Gedankenketten, wodurch sie die einzelnen Schlussfolgerungsschritte explizit abbilden können, um bei komplexen Problemen bessere Ergebnisse zu erzielen.

Offenheit und Verfügbarkeit

Alle seit September veröffentlichten Qwen3-VL-Modelle sind unter der Apache-2.0-Lizenz mit offenen Gewichten auf Hugging Face verfügbar. Das Angebot umfasst dichte Varianten mit 2 Milliarden bis 32 Milliarden Parametern sowie Mixture-of-Experts-Modelle: 30B-A3B und das riesige 235B-A22B.

Funktionen wie die Extraktion von Frames aus langen Videos sind nicht neu – Google Gemini 1.5 Pro beherrschte dies bereits Anfang 2024 –, doch Qwen3-VL bietet eine vergleichbare Leistung in einem offenen Paket. Das vorherige Qwen2.5-VL ist in der Forschung weitverbreitet, sodass das neue Modell die offene Entwicklung wahrscheinlich weiter voranbringen wird.

Weitere Quelle: the-decoder.com

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

ChatGPT führt virtuelle Anprobe für Kleidung und Accessoires einChatGPT führt virtuelle Anprobe für Kleidung und Accessoires ein
OpenAI startet weltweit zwei Shopping-Funktionen in ChatGPT: Nutzer können Kleidung und Accessoires auf einem eigenen Foto visualisieren und ausgewählte Produkte mit Favorites speichern.
1 Min. Lesezeit
2. 10. 2026
Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok