Co je Qwen 3.8 a v čem je jiný
Qwen 3.8 je nová generace otevřených modelů od Alibaby. Firma ji poprvé ukázala 19. července 2026 na konferenci World AI Conference v Šanghaji a během pár týdnů vydala první veřejné checkpointy. Rodina má tři hlavní varianty:
- Qwen 3.8-27B — hustý (dense) model s 27,8 miliardy parametrů, určený pro lokální hardware. Zvládá text, obrázky i video. Licence Apache 2.0, vyšel 14. srpna.
- Qwen 3.8-2.4T-A95B — vlajková loď s 2,4 bilionu parametrů, ze kterých se při každém tokenu aktivuje jen 95 miliard. První „Max-class“ model, který Alibaba kdy vydala s otevřenými váhami.
- Qwen 3.8-Max — stejný mozek jako 2.4T, ale jen přes placené API (QwenCloud), navíc s viděním a kontextem až milion tokenů.
Proč na tom záleží zrovna u 27B verze? Protože je to dense model. Na rozdíl od vlajkových modelů, které používají trik zvaný mixture-of-experts (u každého tokenu se „probudí“ jen zlomek neuronové sítě), tady se u každého generovaného slova zapojí všech 27,8 miliardy parametrů. Žádná zkratka. A přesto drží krok s modely, které jsou desítkykrát větší.
Benchmarky: malý model, velká čísla
Alibaba na oficiální kartě modelu srovnává 27B s Claude Opus 4.6 Max. Výsledky v praktických testech kódování a ovládání počítače vypadají takto:
| Benchmark | Qwen 3.8-27B | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro (kódování) | 61,7 | 53,4 |
| LiveCodeBench v6 | 90,3 | 88,8 |
| OSWorld-Verified (ovládání počítače) | 84,3 | 72,7 |
| AndroidWorld | 81,9 | 62,0 |
| Terminal-Bench 2.1 | 73,0 | 78,2 |
| GPQA Diamond (věda) | 89,2 | 91,3 |
| Humanity's Last Exam | 30,8 | 40,0 |
V kódování a práci s reálným softwarem 27B vítězí. Na nejtěžších úlohách na obecné uvažování (Humanity's Last Exam) naopak ztrácí. Zjednodušeně: na praktickou práci s kódem a s počítačem je překvapivě silný, na vysokoškolskou fyziku a teoretické rébusy zůstávají velké modely napřed.
Srovnání s novějším Claude Sonnet 5 (vydaným 30. června 2026) je ještě výmluvnější. Sonnet 5 vyhrává SWE-bench Pro o 1,5 bodu (63,2 ku 61,7), ale prohrává OSWorld-Verified (81,2 ku 84,3). Tedy doma spustitelný model za nula korun je na více osách konkurenceschopný s vlajkovým uzavřeným modelem.
Jedna fér poznámka: většina čísel pochází od samotné Alibaby a nezávislé audity teprve dohánějí. U čínských laboratoří platí, že vlastní čísla se berou s rezervou. Ale samotný trend — malý otevřený model, který se přetahuje s velkými uzavřenými — těžko zpochybnit.
Cena: kolik ušetříte, když neplatíte cloud
Tady to začíná být pro peněženku zajímavé. Vlajkový Qwen 3.8-Max přes API stojí 2 dolary za milion vstupních a 6 dolarů za milion výstupních tokenů, s jedinou plochou cenou pro celý miliontokenový kontext. Proti konkurenci:
| Model | Vstup ($/1M) | Výstup ($/1M) |
|---|---|---|
| Qwen 3.8-Max | $2,00 | $6,00 |
| Claude Sonnet 5 | $2,00 | $10,00 |
| GPT-5.6 Terra | $2,00 | $12,00 |
| Claude Opus 4.8 | $5,00 | $25,00 |
Proti Claude Opus 4.8 je Qwen 3.8-Max zhruba o 60 % levnější na vstupu a o 76 % na výstupu. Převedeno do korun (při kurzu okolo 23 Kč za dolar): milion výstupních tokenů vyjde na Qwenu na zhruba 138 Kč, zatímco u Opusu na 575 Kč.
Dejme tomu, že provozujete agenta nebo firemního chatbota, který měsíčně vygeneruje 50 milionů výstupních tokenů. U Opusu 4.8 to je 50 × 25 = 1 250 dolarů, tedy asi 28 750 Kč měsíčně. U Qwenu 50 × 6 = 300 dolarů, tedy kolem 6 900 Kč. Rozdíl je přes dvacet tisíc korun měsíčně za srovnatelný výkon. A to ještě pomíjím 27B model, který přes API vůbec platit nemusíte.
Jak si model rozjet doma (a co vás to stojí)
Zajímavější je druhá větev. Qwen 3.8-27B je pod licencí Apache 2.0, takže ho smíte stahovat, upravovat i používat komerčně — zadarmo. Komunitní kvantizace (zmenšené, ztrátové verze modelu) od projektu Unsloth ho dostanou na běžný herní hardware:
| Formát | Velikost | Grafická karta |
|---|---|---|
| Q4_K_M (4 bity) | ~17,1 GB | 24 GB (RTX 4090 / 3090) |
| Q5_K_M | ~19,8 GB | 24 GB |
| 3 bity / IQ | ~13–15 GB | 16 GB |
| IQ2_XXS (2 bity) | ~9 GB | 12 GB |
Nezávislý vývojář Simon Willison naměřil na M5 Max MacBooku Pro a NVIDIA DGX Spark zhruba 15 až 30 tokenů za sekundu — tedy plynulé, použitelné tempo, ne trpělivostní cvičení.
A co je na tom nejlepší pro českého uživatele: model je zdarma, takže jediný provozní náklad je elektřina. RTX 4090 má příkon kolem 450 W. Při české ceně elektřiny zhruba 7 Kč za kWh vyjde hodina plného výkonu na přibližně tři koruny. Pro běžné používání pár hodin denně jste na desítkách korun měsíčně. Žádné předplatné, žádný cloud.
Přidejte k tomu fakt, že otevřené váhy znamenají, že citlivá data neopouštějí váš počítač. Pro firmy, které v EU řeší GDPR, je to podstatný argument — model běží lokálně a nic se nikam neposílá.
Co bude dál
Alibaba zatím nezveřejnila celý plán, ale komunita očekává Qwen 3.8-35B-A3B: model s 35 miliardami parametrů, z nichž se aktivuje jen zhruba 3 miliardy. Předchozí generace Qwen 3.5 nabízela osm velikostí od 0,8B (běží i v telefonu) po 397B, takže menší sourozenci jsou pravděpodobní. Nic z toho ale není oficiálně potvrzené, takže berte výhled s rezervou.
Model má navíc vestavěnou predikci více tokenů najednou, díky které komunita naměřila zhruba 72% nárůst propustnosti. Jinými slovy: Qwen 3.8 nejenže zpochybňuje představu, že „větší je vždy lepší“, ale dělá to i efektivněji.
Je Qwen 3.8 zdarma i pro komerční použití?
Verze 27B je pod licencí Apache 2.0, takže ji můžete volně používat, upravovat i nasadit komerčně bez poplatku. Vlajkový 2.4T model je ke stažení pod vlastní licencí, a placené API (Qwen 3.8-Max) stojí 2 dolary za milion vstupních a 6 dolarů za milion výstupních tokenů.
Podporuje Qwen 3.8 češtinu?
Jde o vícejazyčný model, takže češtinou projde, ale u méně zastoupených jazyků počítejte s o něco slabšími výsledky než v angličtině. Na technické úkoly a kód, kde je jazykem většinou angličtina, to prakticky nevadí.
Musím umět programovat, abych si model rozjel?
Ne. Kvantizovanou verzi ve formátu GGUF stáhnete přes nástroje jako Ollama nebo LM Studio a spustíte na pár kliknutí. Užitečný je spíš hardware: ideálně grafická karta s 16–24 GB paměti.