Přejít k hlavnímu obsahu

Nový model od Alibaby umí průhlednou grafiku. Firmy mají ale smůlu

Ilustrační obrázek

Tým Qwen z dílny Alibaby zveřejnil váhy modelu Qwen-Image-2.1, který v jednom modelu spojuje generování obrázků z textu a jejich editaci. Nejzajímavější novinka je technická: model nativně vytváří obrázky s průhledným pozadím ve formátu RGBA a v editaci zvládne až deset referenčních snímků. Otevřené váhy ale tentokrát neznamenají volné komerční použití. Licence Qwen Research License Agreement povoluje jen nekomerční provoz a na firemní nasazení je potřeba vyžádat zvláštní licenci.

Shrnutí v bodech

  • Generátorová část modelu má 7 miliard parametrů, celý model s textovým enkodérem přes 16 miliard a váhy zabírají 33,1 GB.
  • Nově zvládne generování i editaci v jednom modelu včetně průhledných RGBA obrázků a editace až s deseti referencemi.
  • Vlastní srovnání Qwen-Image-Bench staví model na 60,28 bodu, v čele je konkurence se 67,01 bodu.
  • Licence je pouze nekomerční, starší modely Qwen-Image přitom vycházely pod Apache 2.0.

Co je Qwen-Image-2.1

Generátorová část modelu má 7 miliard parametrů ve 32 vrstvách architektury single-stream DiT. K ní patří textový enkodér Qwen3-VL 8B, který zpracovává jak instrukce, tak vstupní obrázky, a VAE se 64 kanály a šestnáctinásobnou prostorovou kompresí. Trénink stojí na flow matchingu s Eulerovým diskrétním schedulerem.

Marketingové označení 7B se tedy týká jen obrazové části. Celý model má dohromady přes 16 miliard parametrů a váhy na disku zabírají 33,1 GB: textový enkodér 17,5 GB, transformer 14,2 GB a VAE 1,35 GB. To je údaj, který se hodí znát dřív než při plánování vlastního provozu.

Průhlednost místo druhého modelu

V prosinci 2025 vydal Qwen samostatný model Qwen-Image-Layered zaměřený na průhledné vrstvy. Qwen-Image-2.1 tuto schopnost včlenil do jednoho modelu: o tom, zda výstup bude běžný obrázek, nebo obrázek s alfa kanálem, rozhoduje prompt. Model tak z jednoho zadání vytvoří grafiku s průhledným pozadím, kterou lze rovnou skládat do dalších podkladů.

Průhlednost funguje i při editaci. Model umí změnit výraz postavy a průhledné pozadí přitom zachovat, stejně jako přepsat text v průhledné vrstvě. V ukázce Qwen nahradil nápis BLOOM textem Qwen-Image. Z běžné fotografie naopak dokáže vyříznout zvolený objekt do samostatné RGBA vrstvy.

Editace s deseti referencemi

Qwen-Image-2.1 přijme až deset referenčních obrázků a spojí je do jedné scény. V ukázkách ze šesti portrétních referencí vznikne skupinová fotografie, z pěti vstupů (model, oblečení, boty, taška, klobouk) kompletní outfit pro virtuální zkoušení a z deseti referencí zařízení vybavený interiér.

Lokální úpravy se zadávají třemi způsoby: kroužky nakreslenými do obrázku, malovanými značkami nebo samostatnou maskou. Kruhy a malba část původního obrázku zakryjí, maska se proto posílá jako druhý vstup vedle originálu. Qwen u editace zdůrazňuje zachování identity u lidí a věrnost textu, textur a tvaru u produktů, což je pro e-shopy a katalogy praktičtější vlastnost než další kosmetické zlepšení výstupu.

Model pokrývá i širší zadání: panoramata z jednoho selfie, infografiky z fotografie produktu nebo storyboard ze třípohledové reference postavy.

Jak si model stojí

Qwen k vydání přiložil srovnání Qwen-Image-Bench. V jeho vlastním grafu získává Qwen-Image-2.1 60,28 bodu a před ním stojí šest modelů, v čele dva modely OpenAI se 67,01 a 64,69 bodu. Graf zároveň ukazuje rozdíl v nákladech na provoz: u Qwen-Image-2.1 je uvedeno 7B, u uzavřených modelů je místo počtu parametrů jen zámek s poznámkou, že své počty nezveřejňují.

Model tedy nevyhrává kvalitou, ale poměrem výkonu a velikosti. Většinu uzavřené konkurence v grafu poráží, na absolutní špičku ale nedosáhne. Kdo potřebuje nejlepší možný výsledek bez ohledu na cenu, sáhne jinam; kdo řeší, kolik obrázků vygeneruje na jednu grafiku, má důvod se na 7B model podívat.

Nativní 2K rozlišení a provoz

Model generuje rovnou ve 2K rozlišení. Čtverec má 2048 × 2048 pixelů, formát 16:9 2752 × 1536, čtyři ku třem 2400 × 1792 a na výšku 1536 × 2752 pixelů. Výchozí počet kroků je 40. Rychlost řeší architektura s mixed-granularity attention a opětovným použitím KV cache: instrukce a vstupní obrázky se spočítají jednou v prvním kroku a dál se jen používají, což se projeví hlavně při editaci s více vstupy.

Podpora je od prvního dne široká. Model běží v Diffusers přes pipeline QwenImage21Pipeline, nativně v ComfyUI včetně hotových workflow pro generování i editaci, ve vLLM-Omni (FP8 kvantizace, CUDA grafy, tensorová paralelizace), v SGLang-Diffusion, v LightX2V a na ModelScope přes DiffSynth-Studio s možností LoRA tréninku. Na AMD Radeon funguje přes ROCm a přes vrstvu FlagOS i na dalších čipových platformách. Vyzkoušet bez instalace lze v demu na Hugging Face Space.

K modelu Qwen vydal i dva přepisovače promptů vyladěné z Qwen3.5-VL 9B, jeden pro generování a jeden pro editaci. Podle dokumentace mají krátké zadání rozšířit do podrobného popisu, což bývá rozdíl mezi průměrným a použitelným výsledkem.

Licence: otevřené váhy, ale jen pro výzkum

Tady je hlavní rozdíl proti předchozím modelům řady. Qwen-Image z loňského srpna, Qwen-Image-Edit-2509, Qwen-Image-Layered, Qwen-Image-Edit-2511 i Qwen-Image-2512 vycházely pod licencí Apache 2.0, která komerční nasazení umožňuje bez dalšího jednání.

Qwen-Image-2.1 má v repozitáři na GitHubu i v metadatech na Hugging Face licenci Qwen Research License Agreement. Ta povoluje použití, kopírování a úpravy výhradně pro nekomerční účely. Na komerční provoz je potřeba vyžádat si samostatnou licenci, kontakt je uvedený přímo v licenčním textu. Kdo na základě modelu trénuje nebo vylaďuje vlastní AI model, musí v dokumentaci produktu uvést „Built with Qwen" nebo „Improved using Qwen". Licence se řídí čínským právem a spory má řešit soud v Chang-čou.

Pro českou agenturu nebo studio to znamená jediné: model se dá bez obav testovat a zkoumat, ale do zakázkové produkce pro klienty patří až po vyřešení licence. Označování AI výstupů tím není dotčené, to plyne z jiných předpisů než z licence modelu.

Můžu Qwen-Image-2.1 nasadit komerčně?

Ne bez zvláštní licence. Qwen Research License Agreement povoluje pouze nekomerční použití, na firemní provoz je nutné vyžádat samostatnou licenci u společnosti Alibaba.

Vešel by se na běžnou grafiku s 24 GB paměti?

Váhy v přesnosti bf16 mají 33,1 GB, takže se do 24 GB nevejdou celé. Řešením je odkládání vrstev do operační paměti (model offloading) nebo FP8 kvantizace, kterou podporuje vLLM-Omni.

Čím se liší od Qwen-Image-Layered?

Qwen-Image-Layered z prosince 2025 byl specializovaný model jen na průhledné vrstvy. Qwen-Image-2.1 průhlednost spojuje s generováním z textu, editací až s deseti referencemi a nativním 2K rozlišením v jednom modelu.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.