Alibaba pustila do světa Qwen3.8-27B, model s otevřenými váhami, který zvládne text, obrázky i video a běží pod licencí Apache 2.0. Základní kontextové okno má 262 tisíc tokenů a firma tvrdí, že se dá rozšířit až na milion. K vydání přiložila vlastní tabulku měření, ve které Qwen3.8-27B dosahuje 61,7 procenta na SWE-bench Pro proti 53,4 procenta u Claude Opus 4.6 Max. Větší sourozenec Qwen3.8-Max, jehož váhy tým zveřejnil dva dny předtím, zůstává čistě textový, takže největší pozornost získal menší model.
Co vše Qwen3.8-27B umí
Qwen3.8-27B není textový model, ke kterému někdo dodatečně přilepil zpracování obrazu. Zveřejněné váhy přijímají na vstupu text, obrázky i video a vracejí text. Tým Qwen navíc dodává spustitelné ukázky pro obraz i video určené pro práci nad lokální kopií modelu. To stojí za zmínku, protože první vlna článků o řadě Qwen3.8 popisovala otevřené váhy jako čistě textové. U verze Max z 12. srpna to platilo, u sedmadvacítky však ne. Konfigurační soubor obsahuje kompletní obrazový kodér, a příznak, který by u čistě jazykového modelu byl zapnutý, má hodnotu False.
Model od Alibaby cílí na samostatné asistenty běžící lokálně. V oznámení tým Qwen píše, že sedmadvacítka celkově překonává Qwen3.7-Plus a exceluje především v reálném programování a kancelářských úlohách. V praxi to znamená, že klasický (hustý) model o 27 miliardách parametrů, který se vejde na jednu výkonnější spotřebitelskou nebo pracovní grafickou kartu, teď zvládne dlouhé řetězce volání nástrojů. Na ty dřív musel vývojář posílat požadavky do cloudu. Vedle základní verze existuje i Qwen3.8-27B-FP8 s jemným kvantováním a velikostí bloku 128, u které Alibaba mluví o téměř shodném výkonu s originálem.
O optimalizaci rychlosti se postarali tvůrci obslužných knihoven. Tým stojící za SGLang implementoval podporu hned v den vydání a hlásí rychlost 206,1 tokenu za sekundu při dekódování na jediné kartě RTX 5090 s využitím formátu NVFP4. Na výkonné sestavě DGX Spark pak dosahuje propustnosti 38,28 tokenu za sekundu. Rychlou integraci hlásí také projekt vLLM.
Jak si vede v testech
Tabulka výsledků pochází od Alibaby, ale firma alespoň prozradila podmínky. Všechny modely proháněla prostředím Claude Code při teplotě 1,0, hodnotě top_p 0,95 a kontextu 256 tisíc tokenů. Jedinou výjimkou je Claude Opus 4.6 Max na SWE-bench Pro, kde Alibaba použila oficiálně publikované skóre.
Nejširší odstupy si Alibaba připisuje na testech QwenSWEBench, kde hlásí 79 procent proti 63,8 procenta u Claude Opus 4.6 Max, a na CoWorkBench se 70,7 procenta proti 68,2 procenta. Oba testy si firma postavila sama, popsala je jednou větou a nezveřejnila ani seznam úloh, ani počet vzorků. Nikdo je tedy nemůže nezávisle přepočítat. Alibaba také přiznává, že v SWE-bench Pro opravila problematické úlohy a všechny konkurenční modely znovu proměřila na upravené sadě, a že sáhla na několik chybných referenčních odpovědí v testech MathVision a CharXiv. Z inženýrského hlediska to dává smysl, jenže výsledná čísla se pak nedají poskládat vedle skóre naměřených na původních verzích testů.
U obecného uvažování je obrázek smíšenější než u kódu. Qwen3.8-27B dosahuje 89,2 procenta na GPQA Diamond proti 91,3 procenta u Claude Opus 4.6 Max a jen 30,8 procenta na Humanity's Last Exam proti 40 procentům. Naopak vede na LiveCodeBench v6 s 90,3 procenta proti 88,8 procenta a na IFBench se 79,5 procenta proti 62,5 procenta. Největší odstupy si drží u práce s obrazem a s obrazovkou: 84,3 procenta na OSWorld-Verified proti 72,7 procenta, 81,9 procenta na AndroidWorld proti 62 procentům a 90 procent na MathVision proti 65,5 procenta.
Souboj s Muse Glimmer od Mety
Nejpřímější srovnání nabízí Muse Glimmer což je 30miliardový otevřený model od Mety určený k samostatné práci. Ten cílí na stejné využití, tedy na trvale běžícího asistenta na lokálním hardwaru. Na čtyřech testech, kde Alibaba uvádí obě čísla, vyhrává Qwen3.8-27B ve všech případech: Terminal Bench 2.1 (73 % proti 51,7 %); SWE-bench Pro (61,7 % proti 51,2 %); IFBench (79,5 % proti 77 %) a GPQA Diamond (89,2 % proti 83,5 %). Jde o čísla, která pro konkurenční model naměřila sama Alibaba, takže je rozumné brát tyto odstupy s rezervou. Na druhou stranu firma zveřejnila testovací prostředí i parametry generování, což se u podobných tabulek často nevidí.
V rámci vlastní řady je sedmadvacítka tou reálně nasaditelnou variantou. Qwen3.8-Max je model typu Mixture of Experts s 2,4 bilionu parametrů celkem a přibližně 95 miliardami aktivních. Alibaba jej spustila 3. srpna a jeho váhy uvolnila 12. srpna, ty jsou však pouze textové. Qwen3.8-27B je asi stokrát menší, podporu obrazu i videa si zachovává a představuje model, který si většina týmů bude moci skutečně spustit lokálně.
Proč Alibaba vydává otevřené modely
Kolem otevřených vah nyní probíhá ostrý boj o pozice. Meta minulý týden oznámila, že otevře svůj nejsilnější model a přidá verze uzpůsobené pro notebooky. Právě do tohoto konkurenčního prostředí pak Alibaba vyslala svou sedmadvacítku a váhy modelu Max. Podle CNBC to není náhodná souhra. Model běžící na vlastním stroji totiž odpovídá rychleji a uchovává data lokálně, což řada uživatelů považuje za zásadní výhodu z hlediska soukromí. Vedle Alibaby zůstávají v otevřené kategorii silné i společnosti DeepSeek a Moonshot. Meta se svou řadou Llama sice celý tento trend odstartovala, ale čínské laboratoře ji nyní v mnoha ohledech předbíhají.
Rozdíl v rozsahu adopce je jasně patrný ze statistik. Podle serveru CNBC platforma Hugging Face hlásí, že vývojáři na bázi modelů Qwen vytvořili již 151 448 odvozených verzí, což je 2,6krát více než v případě konkurenční Mety. Nick Patience, hlavní analytik pro umělou inteligenci ve společnosti Futurum Group, pro CNBC uvedl, že Alibaba vybudovala z Qwenu nejdůvěryhodnější neamerickou rodinu modelů. Ta jí umožňuje navazovat klíčová partnerství s výrobci hardwaru jak v Číně, tak v rámci celé globální open-source komunity. Samotná Alibaba k sedmadvacítce dodává, že se výkonem vyrovná desetkrát většímu modelu, a vyzdvihuje její přínos pro programování, vědecký výzkum, kancelářskou práci a komplexní samostatné úlohy.



