Alibaba stellt Qwen-Image vor: KI, die mit Worten und Farben malt

Alibaba stellt Qwen-Image vor: KI, die mit Worten und Farben malt

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
6. 8. 2025
4 Minuten Lesezeit
Alibaba stellt Qwen-Image vor: KI, die mit Worten und Farben malt

Alibaba stellt Qwen-Image vor: KI, die mit Worten und Farben malt

Qwen-Image ist das neueste Modell für künstliche Intelligenz von Alibaba Cloud, das auf die Generierung und Bearbeitung von Bildern spezialisiert ist. Dieses Modell mit 20 Milliarden Parametern basiert auf der MMDiT-Architektur und bringt bedeutende Fortschritte bei der komplexen Textdarstellung und präzisen Bildbearbeitung. Laut der offiziellen Ankündigung des Qwen-Teams vom 4. August 2025 ist das Modell auf Plattformen wie GitHub, Hugging Face und ModelScope verfügbar. Sie können es in der Demoversion auf Qwen Chat ausprobieren, indem Sie einfach die Option zur Bildgenerierung auswählen. Das Modell ist unter der Apache-2.0-Lizenz als Open Source verfügbar, was bedeutet, dass es jeder frei verwenden und anpassen kann.

Zu den wichtigsten Eigenschaften gehören eine hervorragende Textdarstellung, konsistente Bildbearbeitung und eine starke Leistung in verschiedenen Benchmarks. Das Modell kann beispielsweise komplexe Textelemente in Bildern verarbeiten, darunter mehrzeilige Anordnungen, Absätze und feine Details, und zwar sowohl in alphabetischen als auch in logografischen Sprachen. Dies macht es zu einem idealen Werkzeug für Content-Ersteller, die präzise und realistische Ergebnisse benötigen.

Leistung und Benchmarks

Qwen-Image wurde anhand mehrerer öffentlicher Benchmarks getestet und erzielte dabei Spitzenergebnisse. Bei Tests wie GenEval, DPG und OneIG-Bench zur Bildgenerierung übertraf es bestehende Modelle. Bei der Bildbearbeitung zeichnet es sich in GEdit, ImgEdit und GSO aus. Insbesondere bei der Textdarstellung, etwa in LongText-Bench, ChineseWord und TextCraft, übertrifft das Modell die Konkurrenz deutlich, vor allem bei der Generierung von Text in logografischen Sprachen. Diese Ergebnisse zeigen, dass Qwen-Image ein leistungsstarkes Basismodell für eine breite Palette von Aufgaben im Bereich visueller Inhalte ist.

Laut Bewertungen aus verschiedenen Quellen, etwa einer technischen Übersicht auf YouTube, benötigt das Modell erhebliche Hardware-Ressourcen – bis zu 57 GB VRAM (Grafikkartenspeicher), um große Versionen lokal auszuführen. Das bedeutet, dass es sich am besten für Benutzer mit leistungsstarker Hardware eignet, dank seines Open-Source-Ansatzes jedoch in verschiedene Anwendungen integriert werden kann. Tester loben seine Fähigkeit, bei Bearbeitungen die semantische Bedeutung und den visuellen Realismus zu bewahren, wodurch es sich sowohl für kreative als auch für analytische Aufgaben eignet.

Benchmarks

Beispiele für die Textdarstellung

Eine der größten Stärken von Qwen-Image ist seine Fähigkeit, Text in unterschiedlichen Szenarien darzustellen. In einem Beispiel im Anime-Stil von Hayao Miyazaki generierte das Modell etwa ein Bild mit Beschriftungen auf Geschäften und Behältern, die sich auf Cloud-Dienste wie Cloud-Speicher, Cloud-Computing und Cloud-Modelle beziehen. Die Figuren weisen präzise Posen und Gesichtsausdrücke auf, und die Schärfentiefe ist realistisch.

Geschäfte

Ein weiteres Beispiel zeigt ein traditionelles Reimpaar, das in einem chinesischen Zimmer mit blau-weißem Porzellan und einem Bild eines berühmten Turms hängt. Das Modell setzte den kalligrafischen Effekt präzise um und generierte Details wie Blumen und Architektur.

Zimmer

In Beispielen mit alphabetischer Sprache bewältigte das Modell das Schaufenster einer Buchhandlung mit Hinweisen auf die Neuerscheinungen dieser Woche, Bestseller und die Titel von vier Büchern. Es verarbeitete sogar eine komplexe Infografik-Folie mit sechs Abschnitten zum emotionalen Wohlbefinden, wobei jedes Modul ein Symbol, eine Überschrift und einen beschreibenden Text enthielt, beispielsweise eine Achtsamkeitsübung mit einem Satz über das Gegenwärtigsein und urteilsfreie Beobachten.

Buchhandlung

Es unterstützt sogar die zweisprachige Darstellung mit wechselnden Sprachen, wie in einem Beispiel, das das Modell als leistungsstarkes Basismodell für komplexe Textdarstellung und präzise Bildbearbeitung beschreibt.

Bildbearbeitung und weitere Fähigkeiten

Bei Qwen-Image geht es nicht nur um die Generierung, sondern auch um die Bearbeitung. Es unterstützt Vorgänge wie Stilübertragung, das Hinzufügen oder Entfernen von Elementen, die Verbesserung von Details, die Bearbeitung von Text und die Anpassung der Posen von Figuren. Dadurch können Benutzer professionelle Ergebnisse ohne komplizierte Software erzielen. Das Modell beherrscht zudem eine große Bandbreite künstlerischer Stile, von fotorealistischen Szenen über impressionistische Gemälde bis hin zu Anime.

Bildbearbeitung

Ein Beispiel ist die Erstellung eines Filmplakats mit einem Titel über entfesselte Vorstellungskraft, einem Untertitel über den Eintritt in eine Welt jenseits der Vorstellungskraft sowie einer mit dem Modell verbundenen Besetzung und Regie. Das zentrale Motiv zeigt einen futuristischen Computer mit explodierenden Farben und Kreaturen, in 32K-Auflösung und mit extrem vielen Details.

Bewertungen und Kommentare von Benutzern

Den verfügbaren Bewertungen und Kommentaren zufolge wird Qwen-Image für seine Open-Source-Verfügbarkeit und die robuste Verarbeitung komplexer Prompts geschätzt. Tester loben seine fotorealistischen Ergebnisse, den hohen Detailgrad und die semantische Konsistenz, insbesondere bei mehrsprachigem Text, bei dem westliche Modelle häufig scheitern. In einer Rezension auf Cybernews werden beispielsweise seine Überlegenheit in Benchmarks wie GenEval und DPG sowie seine Fähigkeit hervorgehoben, Text mit hoher Wiedergabetreue darzustellen.

Benutzer auf Plattformen wie YouTube merken an, dass das Modell dank seines fortschrittlichen Decoders, der komplexe Texturen und eine präzise Beleuchtung erzeugt, ideal für Kreativprofis und Forscher ist. Einige Kommentare weisen jedoch auf Einschränkungen hin, etwa die hohen Hardware-Anforderungen – bis zu 57 GB VRAM für große Modelle. Insgesamt wird Qwen-Image als vielseitiges Werkzeug wahrgenommen, das die Hürden bei der Erstellung visueller Inhalte senkt und Innovationen im Bereich der generativen KI fördert.

Zusammenfassend stellt Qwen-Image einen Fortschritt im Bereich der künstlichen Intelligenz für Bilder dar, wobei der Schwerpunkt auf Präzision und Kreativität liegt. Das Qwen-Team hofft, dass das Modell die Community unterstützt und neue Anwendungen hervorbringt.

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

Altman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamenAltman verkündete die Singularität – wenige Tage, nachdem seine Modelle selbst aus dem Labor entkamen
OpenAI-Chef Sam Altman erklärte in einer Folge des Podcasts Relentless, die Menschheit sei bereits in die Singularität eingetreten. „Wir sind jetzt gewissermaßen in der Singularität“, sagte er wörtlich. Ein Begriff, der jahrzehntelang eher zur Science-Fiction gehörte
6 Min. Lesezeit
28. 7. 2026
KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.KI remixte Madonnas Song – jetzt führt er Australiens Charts an. Musiker sind empört.
Australische Radios spielen seit April Madonnas Dance-Version von Like a Prayer in Dauerschleife. Veröffentlicht vom Queensland-DJ Josh Fawaz, führt sie die Radiocharts an und hat auf Spotify 35 Millionen Streams.
5 Min. Lesezeit
28. 7. 2026
Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?Claude Opus 5 hat einen Shooter von Grund auf programmiert. Was kann Claude of Duty?
Der Ego-Shooter läuft direkt im Browser, bietet eine eigene Physik und elf separate Codebereiche. Insgesamt rund 55.000 Zeilen, verteilt auf elf Subsysteme und aufgebaut auf Thr
4 Min. Lesezeit
28. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok