Alibaba vydala Qwen-Image-2.1, který v jediném stažitelném checkpointu spojuje tvorbu obrázků z textu a úpravy podle instrukcí. Podporuje také výstup s průhledností: kompatibilní pipeline mohou ukládat PNG s alfa kanálem přímo, bez samostatného odstraňování pozadí. Obrazová část modelu má 7 miliard parametrů.
Nativní rozlišení 2 048 × 2 048 a až deset předloh
Podle oznámení Alibaby model vytváří obrázky v nativním rozlišení 2 048 × 2 048 pixelů. Při jednom generování přijímá až 10 referenčních obrázků, takže vstup nemusí být omezený na textové zadání nebo jedinou obrazovou předlohu.
Průhlednost zajišťuje podpora RGBA. Vedle červené, zelené a modré složky zachovává autoenkodér také alfa kanál. Přímé ukládání průhledných PNG závisí na tom, zda tuto možnost podporuje použitá pipeline.
Tři komponenty a přibližně 33 GB ke stažení
Základem obrazové části je 32vrstvý jednoproudový diffusion transformer se 7 miliardami parametrů. Textový enkodér nese označení Qwen3-VL 8B. Obrazový kodek tvoří 64kanálový RGBA variační autoenkodér s 16násobnou prostorovou kompresí.
Celý balík zahrnující obrazový model, enkodér a autoenkodér má přibližně 33 GB. Paměť potřebná při běhu závisí na použité přesnosti, rozlišení a kvantizaci. Roli hraje také přesouvání komponent mimo GPU a to, zda pipeline drží všechny části současně načtené v paměti grafické karty.
První mezi otevřenými vahami, osmnáctý v celkovém pořadí
V žebříčcích Artificial Analysis AA-Image-T2I v2.0 a AA-Image-Editing v2.0 se Qwen-Image-2.1 dostal na první místo mezi modely s otevřenými vahami. V generování z textu získal Elo 1 034, zatímco Ideogram 4.0 (Quality) měl 1 011. V úpravách dosáhl hodnocení 1 074 oproti 1 066 u HunyuanImage 3.0 Instruct.
Elo v těchto hodnoceních převádí výsledky párového porovnávání preferencí na relativní skóre. Čísla jsou srovnatelná pouze uvnitř stejného žebříčku a mohou se měnit s dalšími vyhodnoceními.
Při zahrnutí proprietárních systémů patří novince v Artificial Analysis 18. místo v obou disciplínách. Předchozí Qwen Image 2.0 byl v generování na 72. místě a v úpravách na 58. místě. Celkovému pořadí nadále dominují uzavřené systémy; v LMArena je Qwen-Image-2.1 šestnáctý v úpravách a sedmnáctý v generování z textu.
Zlepšení rozvržení, osvětlení i úprav textu
V kategoriích Artificial Analysis model vede mezi otevřenými vahami v 16 z 36 hodnocení. Pět prvenství připadá na schopnosti generování: složité kompozice a vykreslování textu doplňují kategorie Knowledge, Layout a Lighting. Ve způsobech využití generování vede ve třech kategoriích, které zahrnují tvorbu pro sociální sítě, produktivitu a znalostní práci i spotřebitelské použití. V Architecture a Frontier se o nejlepší výsledek dělí.
U úprav získal prvenství ve třech typech zásahů: změnách textu či symbolů, úpravách založených na uvažování a kompozici či rámování. Dalších pět vedoucích výsledků má mezi způsoby využití úprav. Vedle produktivity a obsahu pro sociální sítě sem patří maloobchod a e-commerce, animace a hry i návrh UI/UX.
Oproti Qwen Image 2.0 se v měření Artificial Analysis zmenšil odstup od nejlepších výsledků ve všech schopnostech generování z textu. Největší zlepšení vykázaly Layout, Lighting a Knowledge. U úprav nastal největší mezigenerační posun v Text or Symbol Edits, Object-Level Edit a Identity-Preserving Edit.
K celkovému lídrovi se nová verze při úpravách nejvíce přiblížila v kategorii Scene and Style Edit. Ta zahrnuje změny osvětlení, vizuálního stylu a nahrazování pozadí.
Stažitelné váhy, komerční použití se samostatnou licencí
Váhy jsou dostupné přes Hugging Face a ModelScope. Diffusers přidal podporu už v den vydání a ComfyUI nabízí hotovou šablonu pracovního postupu. Model podporují také nástroje vLLM-Omni, SGLang a LightX2V.
Dostupnost vah doprovází změna licenčních podmínek. Qwen-Image-2.1 používá Qwen Research License Agreement, který dovoluje pouze nekomerční využití; pro komerční nasazení je nutná samostatná licence od Alibaby. Dřívější vydání Qwen-Image používala Apache 2.0, která komerční použití za svých podmínek umožňovala.



