Přejít k hlavnímu obsahu

Qwen 3.8: otevřený model běží na vaší grafice a v kódu dohání Claude Opus

Čínská AI a DeepSeek
Řekněte mi, jestli vás tohle nezaujme: model s 27 miliardami parametrů, tedy tak malý, že se vejde na jedinou běžnou grafickou kartu, v benchmarcích programování poráží Clauda Opus — model, za který si Anthropic účtuje v přepočtu tisíce korun měsíčně. To teď tvrdí Alibaba se svým Qwen 3.8. A nejde o žádné marketingové plácání: model je ke stažení zdarma pod licencí Apache 2.0, takže si čísla můžete ověřit sami doma.

Co je Qwen 3.8 a v čem je jiný

Qwen 3.8 je nová generace otevřených modelů od Alibaby. Firma ji poprvé ukázala 19. července 2026 na konferenci World AI Conference v Šanghaji a během pár týdnů vydala první veřejné checkpointy. Rodina má tři hlavní varianty:

  • Qwen 3.8-27B — hustý (dense) model s 27,8 miliardy parametrů, určený pro lokální hardware. Zvládá text, obrázky i video. Licence Apache 2.0, vyšel 14. srpna.
  • Qwen 3.8-2.4T-A95B — vlajková loď s 2,4 bilionu parametrů, ze kterých se při každém tokenu aktivuje jen 95 miliard. První „Max-class“ model, který Alibaba kdy vydala s otevřenými váhami.
  • Qwen 3.8-Max — stejný mozek jako 2.4T, ale jen přes placené API (QwenCloud), navíc s viděním a kontextem až milion tokenů.

Proč na tom záleží zrovna u 27B verze? Protože je to dense model. Na rozdíl od vlajkových modelů, které používají trik zvaný mixture-of-experts (u každého tokenu se „probudí“ jen zlomek neuronové sítě), tady se u každého generovaného slova zapojí všech 27,8 miliardy parametrů. Žádná zkratka. A přesto drží krok s modely, které jsou desítkykrát větší.

Benchmarky: malý model, velká čísla

Alibaba na oficiální kartě modelu srovnává 27B s Claude Opus 4.6 Max. Výsledky v praktických testech kódování a ovládání počítače vypadají takto:

BenchmarkQwen 3.8-27BClaude Opus 4.6 Max
SWE-bench Pro (kódování)61,753,4
LiveCodeBench v690,388,8
OSWorld-Verified (ovládání počítače)84,372,7
AndroidWorld81,962,0
Terminal-Bench 2.173,078,2
GPQA Diamond (věda)89,291,3
Humanity's Last Exam30,840,0

V kódování a práci s reálným softwarem 27B vítězí. Na nejtěžších úlohách na obecné uvažování (Humanity's Last Exam) naopak ztrácí. Zjednodušeně: na praktickou práci s kódem a s počítačem je překvapivě silný, na vysokoškolskou fyziku a teoretické rébusy zůstávají velké modely napřed.

Srovnání s novějším Claude Sonnet 5 (vydaným 30. června 2026) je ještě výmluvnější. Sonnet 5 vyhrává SWE-bench Pro o 1,5 bodu (63,2 ku 61,7), ale prohrává OSWorld-Verified (81,2 ku 84,3). Tedy doma spustitelný model za nula korun je na více osách konkurenceschopný s vlajkovým uzavřeným modelem.

Jedna fér poznámka: většina čísel pochází od samotné Alibaby a nezávislé audity teprve dohánějí. U čínských laboratoří platí, že vlastní čísla se berou s rezervou. Ale samotný trend — malý otevřený model, který se přetahuje s velkými uzavřenými — těžko zpochybnit.

Cena: kolik ušetříte, když neplatíte cloud

Tady to začíná být pro peněženku zajímavé. Vlajkový Qwen 3.8-Max přes API stojí 2 dolary za milion vstupních a 6 dolarů za milion výstupních tokenů, s jedinou plochou cenou pro celý miliontokenový kontext. Proti konkurenci:

ModelVstup ($/1M)Výstup ($/1M)
Qwen 3.8-Max$2,00$6,00
Claude Sonnet 5$2,00$10,00
GPT-5.6 Terra$2,00$12,00
Claude Opus 4.8$5,00$25,00

Proti Claude Opus 4.8 je Qwen 3.8-Max zhruba o 60 % levnější na vstupu a o 76 % na výstupu. Převedeno do korun (při kurzu okolo 23 Kč za dolar): milion výstupních tokenů vyjde na Qwenu na zhruba 138 Kč, zatímco u Opusu na 575 Kč.

Dejme tomu, že provozujete agenta nebo firemního chatbota, který měsíčně vygeneruje 50 milionů výstupních tokenů. U Opusu 4.8 to je 50 × 25 = 1 250 dolarů, tedy asi 28 750 Kč měsíčně. U Qwenu 50 × 6 = 300 dolarů, tedy kolem 6 900 Kč. Rozdíl je přes dvacet tisíc korun měsíčně za srovnatelný výkon. A to ještě pomíjím 27B model, který přes API vůbec platit nemusíte.

Jak si model rozjet doma (a co vás to stojí)

Zajímavější je druhá větev. Qwen 3.8-27B je pod licencí Apache 2.0, takže ho smíte stahovat, upravovat i používat komerčně — zadarmo. Komunitní kvantizace (zmenšené, ztrátové verze modelu) od projektu Unsloth ho dostanou na běžný herní hardware:

FormátVelikostGrafická karta
Q4_K_M (4 bity)~17,1 GB24 GB (RTX 4090 / 3090)
Q5_K_M~19,8 GB24 GB
3 bity / IQ~13–15 GB16 GB
IQ2_XXS (2 bity)~9 GB12 GB

Nezávislý vývojář Simon Willison naměřil na M5 Max MacBooku Pro a NVIDIA DGX Spark zhruba 15 až 30 tokenů za sekundu — tedy plynulé, použitelné tempo, ne trpělivostní cvičení.

A co je na tom nejlepší pro českého uživatele: model je zdarma, takže jediný provozní náklad je elektřina. RTX 4090 má příkon kolem 450 W. Při české ceně elektřiny zhruba 7 Kč za kWh vyjde hodina plného výkonu na přibližně tři koruny. Pro běžné používání pár hodin denně jste na desítkách korun měsíčně. Žádné předplatné, žádný cloud.

Přidejte k tomu fakt, že otevřené váhy znamenají, že citlivá data neopouštějí váš počítač. Pro firmy, které v EU řeší GDPR, je to podstatný argument — model běží lokálně a nic se nikam neposílá.

Co bude dál

Alibaba zatím nezveřejnila celý plán, ale komunita očekává Qwen 3.8-35B-A3B: model s 35 miliardami parametrů, z nichž se aktivuje jen zhruba 3 miliardy. Předchozí generace Qwen 3.5 nabízela osm velikostí od 0,8B (běží i v telefonu) po 397B, takže menší sourozenci jsou pravděpodobní. Nic z toho ale není oficiálně potvrzené, takže berte výhled s rezervou.

Model má navíc vestavěnou predikci více tokenů najednou, díky které komunita naměřila zhruba 72% nárůst propustnosti. Jinými slovy: Qwen 3.8 nejenže zpochybňuje představu, že „větší je vždy lepší“, ale dělá to i efektivněji.

Je Qwen 3.8 zdarma i pro komerční použití?

Verze 27B je pod licencí Apache 2.0, takže ji můžete volně používat, upravovat i nasadit komerčně bez poplatku. Vlajkový 2.4T model je ke stažení pod vlastní licencí, a placené API (Qwen 3.8-Max) stojí 2 dolary za milion vstupních a 6 dolarů za milion výstupních tokenů.

Podporuje Qwen 3.8 češtinu?

Jde o vícejazyčný model, takže češtinou projde, ale u méně zastoupených jazyků počítejte s o něco slabšími výsledky než v angličtině. Na technické úkoly a kód, kde je jazykem většinou angličtina, to prakticky nevadí.

Musím umět programovat, abych si model rozjel?

Ne. Kvantizovanou verzi ve formátu GGUF stáhnete přes nástroje jako Ollama nebo LM Studio a spustíte na pár kliknutí. Užitečný je spíš hardware: ideálně grafická karta s 16–24 GB paměti.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.