Alibabas Qwen-Team hat am 20. September Qwen-Image-2.1 veröffentlicht, und das Ding gefällt mir richtig gut. Ein einziges 7B-Modell erzeugt Bilder und bearbeitet sie, liefert native Transparenz und schafft 2K-Auflösung. Die Gewichte liegen offen auf Hugging Face und ModelScope.

Das Highlight ist der RGBA-Ausgang: Sprites, Logos, Icons oder Produktfreisteller kommen direkt mit Alpha-Kanal aus dem Modell, ohne dass ihr Hintergründe nachträglich wegrechnen müsst. Dazu verarbeitet es bis zu zehn Referenzbilder gleichzeitig, etwa für Gruppenporträts oder Anproben. Lokale Änderungen steuert ihr per Einkreisen, Maske oder eingezeichneter Markierung, und Text im Bild soll dort landen, wo ihr ihn hinschreibt.

Technik im Überblick

  • Generator: 7 Milliarden Parameter, 32-Layer-DiT, ausgelegt auf bis zu 2048×2048 Pixel direkt
  • Text-Encoder: Qwen3-VL 8B, dazu ein RGBA-VAE mit 64 Kanälen
  • Standard: 40 Inferenzschritte
  • Unterstützt in: ComfyUI (nativ ab Tag null), Diffusers, vLLM-Omni und SGLang

Wie gut ist es wirklich?

Alibaba sagt, das Modell schlage die meisten geschlossenen Konkurrenten, aber die Zahlen stammen aus dem eigenen Benchmark. Eine unabhängige, reproduzierbare Vergleichstabelle gegen GPT-Image, Midjourney oder FLUX gibt es zum Start noch nicht, das hält auch Tech Insider fest. Ich nenne deshalb bewusst keine Punktwerte. Bis Drittanbieter nachmessen, hilft nur selbst testen.

Zum Ausprobieren würde ich diese Dinge prüfen: Text in Plakaten und Infografiken, Transparenz bei feinen Kanten wie Haaren oder Glas, Konsistenz einer Figur über mehrere Referenzbilder und Kleinstbearbeitungen per Maske.

Läuft das bei euch?

Laut The Decoder reicht eine Consumer-Karte wie die RTX 3090. Rechnet aber nicht nur mit den 7B: Zum Generator kommt der 8B-Encoder, ein 24-GB-Setup wird laut DEV Community eher mit Quantisierung oder Offloading entspannt. Eine größere „volle" Variante gibt es im offenen Release nicht, das GitHub-Repo dokumentiert nur die 7B-Komponente.

Der Haken: Die Lizenz ist eine Research-Lizenz. Nutzen, verändern und weitergeben ist für nichtkommerzielle Forschung erlaubt, kommerzieller Einsatz braucht eine separate Vereinbarung mit Qwen, Preise dafür sind offen. Für Hobby-Projekte und Prototypen passt das, für Produkte müsst ihr vorher fragen.

Ehrlich gesagt finde ich die Kombination stark: Generieren, Bearbeiten und Freistellen in einem Modell auf eigener Hardware. Wir probieren es selbst aus und berichten, wie es sich im Alltag schlägt.