Qwen3.8-27B: Was Alibabas neues Open-Source-Modell kann und wo seine Schwächen liegen

Qwen3.8-27B: Was Alibabas neues Open-Source-Modell kann und wo seine Schwächen liegen

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
18. 8. 2026
5 Minuten Lesezeit · 3 Aufrufe
Artikel anhören
Audioversion des Artikels
Qwen3.8-27B: Was Alibabas neues Open-Source-Modell kann und wo seine Schwächen liegen

Alibaba hat Qwen3.8-27B veröffentlicht, ein Modell mit offenen Gewichten, das Text, Bilder und Videos verarbeiten kann und unter der Apache-2.0-Lizenz läuft. Das grundlegende Kontextfenster umfasst 262.000 Token, und das Unternehmen gibt an, dass es sich auf bis zu eine Million erweitern lässt. Zur Veröffentlichung legte es eine eigene Ergebnistabelle vor, in der Qwen3.8-27B beim SWE-bench Pro 61,7 Prozent erreicht, gegenüber 53,4 Prozent bei Claude Opus 4.6 Max. Das größere Geschwistermodell Qwen3.8-Max, dessen Gewichte das Team zwei Tage zuvor veröffentlicht hatte, bleibt ein reines Textmodell, weshalb das kleinere Modell die größte Aufmerksamkeit erhielt.

Was Qwen3.8-27B alles kann

Qwen3.8-27B ist kein Textmodell, dem nachträglich eine Bildverarbeitung angeheftet wurde. Die veröffentlichten Gewichte akzeptieren als Eingabe Text, Bilder und Videos und geben Text zurück. Das Qwen-Team stellt außerdem ausführbare Beispiele für Bilder und Videos bereit, die für die Arbeit mit einer lokalen Kopie des Modells bestimmt sind. Das ist erwähnenswert, weil die erste Welle von Artikeln über die Qwen3.8-Reihe die offenen Gewichte als reine Textmodelle beschrieb. Auf die Max-Version vom 12. August traf das zu, auf das 27-Milliarden-Modell jedoch nicht. Die Konfigurationsdatei enthält einen vollständigen Bild-Encoder, und das Flag, das bei einem reinen Sprachmodell aktiviert wäre, hat den Wert False.

Das Modell von Alibaba zielt auf autonom arbeitende Assistenten ab, die lokal ausgeführt werden. In der Ankündigung schreibt das Qwen-Team, dass das 27-Milliarden-Modell Qwen3.7-Plus insgesamt übertrifft und insbesondere bei realen Programmier- und Büroaufgaben glänzt. In der Praxis bedeutet das, dass ein klassisches (dichtes) Modell mit 27 Milliarden Parametern, das auf eine einzelne leistungsfähigere Consumer- oder Workstation-Grafikkarte passt, nun lange Ketten von Werkzeugaufrufen bewältigen kann. Für diese musste ein Entwickler Anfragen früher an die Cloud senden. Neben der Basisversion gibt es auch Qwen3.8-27B-FP8 mit feiner Quantisierung und einer Blockgröße von 128, bei der Alibaba von einer nahezu identischen Leistung wie beim Original spricht.

Um die Geschwindigkeitsoptimierung kümmerten sich die Entwickler der Serving-Bibliotheken. Das Team hinter SGLang implementierte die Unterstützung noch am Tag der Veröffentlichung und meldet bei der Dekodierung auf einer einzelnen RTX-5090-Karte unter Verwendung des NVFP4-Formats eine Geschwindigkeit von 206,1 Token pro Sekunde. Auf einem leistungsstarken DGX-Spark-System erreicht das Modell einen Durchsatz von 38,28 Token pro Sekunde. Auch das vLLM-Projekt meldet eine schnelle Integration. 

Wie es in Tests abschneidet

Die Ergebnistabelle stammt von Alibaba, doch das Unternehmen hat zumindest die Testbedingungen offengelegt. Alle Modelle wurden in der Claude-Code-Umgebung mit einer Temperatur von 1,0, einem top_p-Wert von 0,95 und einem Kontext von 256.000 Token getestet. Die einzige Ausnahme ist Claude Opus 4.6 Max beim SWE-bench Pro, für den Alibaba den offiziell veröffentlichten Wert verwendete.

Ein Benchmark-Diagramm mit den Bezeichnungen SWE-Pro, TerminalBench-2.1 und PaperBench vergleicht Qwen3.8-Max mit weiteren Modellen.
Benchmark-Ergebnisse.

Die größten Abstände verbucht Alibaba bei den QwenSWEBench-Tests, wo es 79 Prozent gegenüber 63,8 Prozent bei Claude Opus 4.6 Max meldet, sowie beim CoWorkBench mit 70,7 Prozent gegenüber 68,2 Prozent. Beide Tests hat das Unternehmen selbst erstellt, mit jeweils einem Satz beschrieben und weder die Aufgabenliste noch die Anzahl der Stichproben veröffentlicht. Daher kann niemand die Ergebnisse unabhängig nachprüfen. Alibaba räumt außerdem ein, dass es im SWE-bench Pro problematische Aufgaben korrigiert und alle Konkurrenzmodelle mit dem angepassten Datensatz erneut getestet sowie einige fehlerhafte Referenzantworten in den Tests MathVision und CharXiv geändert hat. Aus technischer Sicht ergibt das Sinn, doch die daraus resultierenden Zahlen lassen sich anschließend nicht neben die mit den ursprünglichen Testversionen gemessenen Werte stellen.

Beim allgemeinen Schlussfolgern ist das Bild gemischter als beim Programmieren. Qwen3.8-27B erreicht beim GPQA Diamond 89,2 Prozent gegenüber 91,3 Prozent bei Claude Opus 4.6 Max und bei Humanity's Last Exam lediglich 30,8 Prozent gegenüber 40 Prozent. Dagegen führt es beim LiveCodeBench v6 mit 90,3 Prozent gegenüber 88,8 Prozent und beim IFBench mit 79,5 Prozent gegenüber 62,5 Prozent. Die größten Abstände erzielt es bei der Arbeit mit Bildern und Bildschirmen: 84,3 Prozent beim OSWorld-Verified gegenüber 72,7 Prozent, 81,9 Prozent beim AndroidWorld gegenüber 62 Prozent und 90 Prozent beim MathVision gegenüber 65,5 Prozent.

Duell mit Metas Muse Glimmer

Den direktesten Vergleich bietet Muse Glimmer, ein offenes Modell von Meta mit 30 Milliarden Parametern, das für autonomes Arbeiten vorgesehen ist. Es zielt auf denselben Anwendungsfall ab, nämlich einen dauerhaft laufenden Assistenten auf lokaler Hardware. In den vier Tests, für die Alibaba beide Werte angibt, gewinnt Qwen3.8-27B in jedem Fall: Terminal Bench 2.1 (73 % gegenüber 51,7 %); SWE-bench Pro (61,7 % gegenüber 51,2 %); IFBench (79,5 % gegenüber 77 %) und GPQA Diamond (89,2 % gegenüber 83,5 %). Dabei handelt es sich um Werte, die Alibaba selbst für das Konkurrenzmodell gemessen hat, weshalb es vernünftig ist, diese Abstände mit Vorsicht zu betrachten. Andererseits hat das Unternehmen sowohl die Testumgebung als auch die Generierungsparameter veröffentlicht, was bei ähnlichen Tabellen häufig nicht der Fall ist.

Innerhalb der eigenen Modellreihe ist das 27-Milliarden-Modell die tatsächlich einsetzbare Variante. Qwen3.8-Max ist ein Mixture-of-Experts-Modell mit insgesamt 2,4 Billionen Parametern und ungefähr 95 Milliarden aktiven Parametern. Alibaba stellte es am 3. August vor und veröffentlichte seine Gewichte am 12. August, diese sind jedoch ausschließlich textbasiert. Qwen3.8-27B ist ungefähr hundertmal kleiner, behält die Unterstützung für Bilder und Videos bei und stellt ein Modell dar, das die meisten Teams tatsächlich lokal ausführen können.

Warum Alibaba offene Modelle veröffentlicht

Bei offenen Gewichten findet derzeit ein harter Kampf um Marktpositionen statt. Meta kündigte vergangene Woche an, sein leistungsstärkstes Modell zu öffnen und für Notebooks optimierte Versionen hinzuzufügen. In genau dieses Wettbewerbsumfeld brachte Alibaba anschließend sein 27-Milliarden-Modell und die Gewichte des Max-Modells. Laut CNBC ist das kein zufälliges Zusammentreffen. Ein auf dem eigenen Rechner ausgeführtes Modell antwortet nämlich schneller und speichert Daten lokal, was viele Nutzer unter Datenschutzaspekten als entscheidenden Vorteil betrachten. Neben Alibaba bleiben auch DeepSeek und Moonshot in der offenen Kategorie stark. Meta hat mit seiner Llama-Reihe diesen gesamten Trend zwar angestoßen, wird inzwischen jedoch in vielerlei Hinsicht von chinesischen Laboren überholt.

Der Unterschied beim Umfang der Verbreitung ist in den Statistiken deutlich zu erkennen. Laut CNBC meldet die Plattform Hugging Face, dass Entwickler auf Basis der Qwen-Modelle bereits 151.448 abgeleitete Versionen erstellt haben, 2,6-mal so viele wie beim Konkurrenten Meta. Nick Patience, leitender Analyst für künstliche Intelligenz bei der Futurum Group, erklärte gegenüber CNBC, Alibaba habe Qwen zur vertrauenswürdigsten nichtamerikanischen Modellfamilie aufgebaut. Diese ermöglicht es dem Unternehmen, sowohl in China als auch innerhalb der gesamten globalen Open-Source-Community wichtige Partnerschaften mit Hardwareherstellern einzugehen. Alibaba selbst erklärt zum 27-Milliarden-Modell, dass es bei der Leistung mit einem zehnmal größeren Modell mithalten könne, und hebt seinen Nutzen für Programmierung, wissenschaftliche Forschung, Büroarbeit und komplexe autonome Aufgaben hervor.

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

EU will Amerika und China einholen und schreibt sieben KI-Gigafabriken ausEU will Amerika und China einholen und schreibt sieben KI-Gigafabriken aus
Brüssel will bis zu sieben riesige Rechenzentren für künstliche Intelligenz errichten. Öffentliche Gelder sollen private Investitionen anlocken und Europa helfen, zu den USA und China aufzuschließen.
6 Min. Lesezeit
24. 8. 2026
Meta zahlt Microsoft jährlich Hunderte Millionen Dollar für konkurrierende KI-ModelleMeta zahlt Microsoft jährlich Hunderte Millionen Dollar für konkurrierende KI-Modelle
Meta baut zwar eine eigene KI-Infrastruktur auf, greift bei der Entwicklung jedoch über Microsoft Azure auf konkurrierende Modelle zurück. Dafür zahlt der Konzern jährlich Hunderte Millionen Dollar.
4 Min. Lesezeit
24. 8. 2026
Anthropic plant Börsengang im Oktober und dürfte selbst den Rekordstart von SpaceX übertreffenAnthropic plant Börsengang im Oktober und dürfte selbst den Rekordstart von SpaceX übertreffen
Der Entwickler der Claude-Modelle bereitet einen historischen Börsengang mit einer Bewertung von bis zu zwei Billionen Dollar vor. Hinter dem rasanten Umsatzwachstum stehen jedoch enorme Verluste und hohe Kosten für die KI-Entwicklung.
3 Min. Lesezeit
24. 8. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok