Qwen-Image-2.1 spojuje tvorbu a úpravy obrázků s průhledným výstupem

Qwen-Image-2.1 spojuje tvorbu a úpravy obrázků s průhledným výstupem

Ondřej Barták
Ondřej Barták
podnikatel a programátor
3. 10. 2026
3 minut čtení · 9 zhlédnutí
Poslechněte si článek
Audio verze článku
Qwen-Image-2.1 spojuje tvorbu a úpravy obrázků s průhledným výstupem

Alibaba vydala Qwen-Image-2.1, který v jediném stažitelném checkpointu spojuje tvorbu obrázků z textu a úpravy podle instrukcí. Podporuje také výstup s průhledností: kompatibilní pipeline mohou ukládat PNG s alfa kanálem přímo, bez samostatného odstraňování pozadí. Obrazová část modelu má 7 miliard parametrů.

Nativní rozlišení 2 048 × 2 048 a až deset předloh

Podle oznámení Alibaby model vytváří obrázky v nativním rozlišení 2 048 × 2 048 pixelů. Při jednom generování přijímá až 10 referenčních obrázků, takže vstup nemusí být omezený na textové zadání nebo jedinou obrazovou předlohu.

Průhlednost zajišťuje podpora RGBA. Vedle červené, zelené a modré složky zachovává autoenkodér také alfa kanál. Přímé ukládání průhledných PNG závisí na tom, zda tuto možnost podporuje použitá pipeline.

Tři komponenty a přibližně 33 GB ke stažení

Základem obrazové části je 32vrstvý jednoproudový diffusion transformer se 7 miliardami parametrů. Textový enkodér nese označení Qwen3-VL 8B. Obrazový kodek tvoří 64kanálový RGBA variační autoenkodér s 16násobnou prostorovou kompresí.

Celý balík zahrnující obrazový model, enkodér a autoenkodér má přibližně 33 GB. Paměť potřebná při běhu závisí na použité přesnosti, rozlišení a kvantizaci. Roli hraje také přesouvání komponent mimo GPU a to, zda pipeline drží všechny části současně načtené v paměti grafické karty.

První mezi otevřenými vahami, osmnáctý v celkovém pořadí

V žebříčcích Artificial Analysis AA-Image-T2I v2.0 a AA-Image-Editing v2.0 se Qwen-Image-2.1 dostal na první místo mezi modely s otevřenými vahami. V generování z textu získal Elo 1 034, zatímco Ideogram 4.0 (Quality) měl 1 011. V úpravách dosáhl hodnocení 1 074 oproti 1 066 u HunyuanImage 3.0 Instruct.

Elo v těchto hodnoceních převádí výsledky párového porovnávání preferencí na relativní skóre. Čísla jsou srovnatelná pouze uvnitř stejného žebříčku a mohou se měnit s dalšími vyhodnoceními.

Při zahrnutí proprietárních systémů patří novince v Artificial Analysis 18. místo v obou disciplínách. Předchozí Qwen Image 2.0 byl v generování na 72. místě a v úpravách na 58. místě. Celkovému pořadí nadále dominují uzavřené systémy; v LMArena je Qwen-Image-2.1 šestnáctý v úpravách a sedmnáctý v generování z textu.

Zlepšení rozvržení, osvětlení i úprav textu

V kategoriích Artificial Analysis model vede mezi otevřenými vahami v 16 z 36 hodnocení. Pět prvenství připadá na schopnosti generování: složité kompozice a vykreslování textu doplňují kategorie Knowledge, Layout a Lighting. Ve způsobech využití generování vede ve třech kategoriích, které zahrnují tvorbu pro sociální sítě, produktivitu a znalostní práci i spotřebitelské použití. V Architecture a Frontier se o nejlepší výsledek dělí.

U úprav získal prvenství ve třech typech zásahů: změnách textu či symbolů, úpravách založených na uvažování a kompozici či rámování. Dalších pět vedoucích výsledků má mezi způsoby využití úprav. Vedle produktivity a obsahu pro sociální sítě sem patří maloobchod a e-commerce, animace a hry i návrh UI/UX.

Oproti Qwen Image 2.0 se v měření Artificial Analysis zmenšil odstup od nejlepších výsledků ve všech schopnostech generování z textu. Největší zlepšení vykázaly Layout, Lighting a Knowledge. U úprav nastal největší mezigenerační posun v Text or Symbol Edits, Object-Level Edit a Identity-Preserving Edit.

K celkovému lídrovi se nová verze při úpravách nejvíce přiblížila v kategorii Scene and Style Edit. Ta zahrnuje změny osvětlení, vizuálního stylu a nahrazování pozadí.

Stažitelné váhy, komerční použití se samostatnou licencí

Váhy jsou dostupné přes Hugging Face a ModelScope. Diffusers přidal podporu už v den vydání a ComfyUI nabízí hotovou šablonu pracovního postupu. Model podporují také nástroje vLLM-Omni, SGLang a LightX2V.

Dostupnost vah doprovází změna licenčních podmínek. Qwen-Image-2.1 používá Qwen Research License Agreement, který dovoluje pouze nekomerční využití; pro komerční nasazení je nutná samostatná licence od Alibaby. Dřívější vydání Qwen-Image používala Apache 2.0, která komerční použití za svých podmínek umožňovala.

Reklama

S tvorbou obsahu pomáhá UpTier.

SEO a GEO na autopilota. Multiagentní systémy UpTier píší a optimalizují obsah pro vyhledávače i AI odpovědi.

Objevte UpTier ↗

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Apple plánuje přísnější udělování plného přístupu k disku v macOSApple plánuje přísnější udělování plného přístupu k disku v macOS
Apple oznámil nové kontroly oprávnění Full Disk Access kvůli rizikům AI agentů. Udělení přístupu má vyžadovat výslovný úkon uživatele a Apple chce předem lépe vysvětlit související rizika.
1 min čtení
3. 10. 2026
Microsoft vydal MAI-Transcribe-2-Streaming pro průběžný přepis řečiMicrosoft vydal MAI-Transcribe-2-Streaming pro průběžný přepis řeči
MAI-Transcribe-2-Streaming vytváří text už během příjmu zvuku. V hodnocení Artificial Analysis měl nejnižší chybovost finálního přepisu mezi 38 modely. Dostupný je přes Voice Live API ve veřejném preview.
2 min čtení
2. 10. 2026
CoreWeave spouští Forge pro trénování a průběžné zlepšování AI agentůCoreWeave spouští Forge pro trénování a průběžné zlepšování AI agentů
Forge propojuje trénování, vyhodnocování a zlepšování modelů s poznatky z jejich provozu. Nabízí dotrénování bez vlastního clusteru, analýzu experimentů a izolovaná prostředí pro agenty.
2 min čtení
2. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok