Co Alibaba oznámila
Blog Qwen3.8-Max: A New Bar for Coding and Cowork vyšel dnes, 3. srpna 2026, v 10:00 pekingského času. Klíčová čísla: 2,4 bilionu parametrů celkem, z toho 95 miliard aktivních. Model je tedy typu MoE (Mixture of Experts) — při každém dotazu se aktivuje jen zlomek sítě, což zásadně snižuje výpočetní náklady oproti stejně velkému „hustému" modelu.
Model je od dneška dostupný přes API na platformě QwenCloud. Kontextové okno činí 1 milion tokenů, maximální vstup 991 tisíc a výstup 131 tisíc tokenů.
Alibaba prezentuje tři velké případové studie. V první model přes 10 dní autonomně stavěl projekt oh-my-cli — k 30. červenci 2026 repozitář obsahoval po zhruba 16 dnech plně autonomního provozu 265 commitů, 127 pull requestů a 151 issues. Ve druhé model dostal vědecký článek a úkol reprodukovat jeho experiment a poté ho zlepšit; za ~125 hodin napsal asi 7 600 řádků kódu, provedl přes 1 100 akcí a 33 kol trénování na GPU, načež vlastní metodou překonal původní práci o 2,71 bodu na matematickém benchmarku AIME24. Ve třetí se model přihlásil do reálné soutěže na platformě Tianchi s 526 lidskými týmy a za 24 hodin se přes 45 odevzdání dostal na přesnost 0,853, čímž porazil 458 z nich.
Benchmarky: titulek říká kódování, tabulka říká něco jiného
Tady se to začíná zajímat. Prošli jsme všech 31 řádků hlavní benchmarkové tabulky, kde Alibaba srovnává Qwen3.8-Max s Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol a vlastní předchozí generací. Napočítali jsme, kolikrát nový model skutečně vede.
Výsledek: Qwen3.8-Max vyhrává jen v šesti z 31 řádků (PaperBench, WideSearch, IFBench, HealthBench, PLawBench a PRBench-Finance), v jednom dělí první místo. V dvanáctiřádkové sekci „Coding Agent" — tedy přesně tam, kde má být „nová laťka" — vyhrává jediný benchmark, PaperBench se skóre 93,0.
Ještě výmluvnější je jeden detail. Alibaba do tabulky zařadila čtyři vlastní interní benchmarky — QwenSWEBench, QwenQoderBench, QwenReactBench a QwenSVGBench. Na všech čtyřech domácích testech Qwen3.8-Max prohrává s konkurencí: v prvních třech vede Claude Fable 5 (86,3 vs. 80,7; 63,1 vs. 58,4; 1770 vs. 1724 bodů Elo), ve čtvrtém GPT-5.6 Sol (1758 vs. 1713). Když model nevyhraje ani na testech, které si jeho tvůrci sami navrhli, je slovo „laťka" v titulku přinejmenším odvážné.
Kde ale Qwen3.8-Max opravdu válí, je multimodalita — a ta je v komunikaci naopak podceněná. V tabulce vizuálního uvažování vede v devíti z dvanácti řádků: MathVision 95,2, LogicVista 91,9, HiPhO 90,0, SLAKE 90,8. V sekci práce s dokumenty a OCR vyhrává prakticky vše — OmniDocBench 92,1, CC-OCR-Bench-V2 79,6, MADQA 91,8. Zvlášť nápadný je skok na BabyVision: z 64,7 bodu u předchozí generace na 82,0, zatímco Claude Opus 4.8 má 28,4.
Náš závěr: Qwen3.8-Max není nejlepší kódovací model na trhu — v agentním kódování zůstává za Claude Fable 5 i GPT-5.6 Sol. Je to ale patrně nejlepší veřejně dostupný model pro vidění, dokumenty a OCR. To je pro spoustu firemního nasazení (zpracování faktur, skenů, výkresů) zajímavější zpráva než další procento na SWE-bench.
Cena: přepočet na koruny
Qwen3.8-Max stojí podle ceníku QwenCloud 2 USD za milion vstupních tokenů a 6 USD za milion výstupních. Podle kurzu ČNB k dnešnímu dni (1 USD = 21,076 Kč) jsme to přepočítali a srovnali s konkurencí z benchmarkové tabulky:
| Model | Vstup (Kč / 1 mil. tokenů) | Výstup (Kč / 1 mil. tokenů) |
|---|---|---|
| Qwen3.8-Max | 42 Kč | 126 Kč |
| Claude Opus 4.8 | 105 Kč | 527 Kč |
| GPT-5.6 Sol | 105 Kč | 632 Kč |
| Claude Fable 5 | 211 Kč | 1 054 Kč |
Na výstupních tokenech — kterých agentní úlohy spotřebují nejvíc — je Qwen3.8-Max 4,2× levnější než Claude Opus 4.8 a 8,4× levnější než Claude Fable 5. Tohle je ta skutečná zbraň: model nemusí být nejlepší, když je za pětinu ceny slušně dobrý. Během náběhové fáze navíc Alibaba účtuje 10 % standardní sazby, tedy zhruba 4 Kč za milion vstupních tokenů.
Otevřené váhy: co to znamená pro člověka s jedním počítačem
Alibaba slibuje uvolnit váhy Qwen3.8-Max příští týden, spolu s menším modelem Qwen3.8-27B. Spočítali jsme si, co to prakticky obnáší. 2,4 bilionu parametrů ve čtyřbitové kvantizaci zabere zhruba 1,2 TB — v FP8 dvojnásobek. Ani po agresivní kvantizaci se model nevejde na jednu GPU; potřebovali byste přibližně patnáct karet H100 s 80 GB paměti. „Otevřené váhy" tu tedy neznamenají „spustíte si to doma", ale „velké firmy a hostingoví poskytovatelé to mohou provozovat na vlastním železe" — což je pro evropské firmy s požadavky na datovou suverenitu podstatný rozdíl.
Reálně zajímavý je pro jednotlivce menší Qwen3.8-27B. A tady můžeme přispět vlastními čísly.
Naše měření: proč na architektuře záleží víc než na velikosti
V naší testovací laboratoři AI Arena provozujeme dlouhodobé srovnávání lokálních modelů na jedné konfiguraci: NVIDIA RTX 5060 Ti s 16 GB VRAM, procesor AMD Ryzen, 32 GB DDR5, Ubuntu 24.04 LTS. Od 18. května do dneška jsme nasbírali 639 dokončených běhů. Mezi testovanými modely jsou dva Qweny, a jejich srovnání je učebnicová ukázka toho, proč Alibaba u velkého modelu sáhla po architektuře MoE.
Porovnali jsme qwen3-coder:30b (architektura MoE, 157 běhů) a qwen3:32b-q4_K_M (hustý model, 123 běhů) na třech shodných vývojářských úlohách:
| Úloha | qwen3-coder:30b (MoE) | qwen3:32b (hustý) | Rozdíl |
|---|---|---|---|
| PHP modul pro Drupal | 65,1 s | 849,9 s | 13,1× |
| HTML/JS animace | 164,4 s | 1 035,0 s | 6,3× |
| Python vizualizace galaxie | 147,1 s | 982,7 s | 6,7× |
V průměrné rychlosti generování je rozdíl ještě názornější: 36,3 tokenu za sekundu u MoE modelu proti 4,2 tokenu u hustého — tedy 8,6násobek. Přitom jde o modely prakticky stejné velikosti na papíře (30 vs. 32 miliard parametrů). Důvod je prostý: hustý model v kvantizaci q4 potřebuje kolem 19–20 GB, což se do 16GB karty nevejde, takže se část výpočtu odsouvá do systémové paměti a rychlost se propadne. MoE model aktivuje jen zlomek vah, vejde se, a běží.
Pro Qwen3.8-27B to znamená konkrétní vodítko: ve čtyřbitové kvantizaci se dostane zhruba na 16–17 GB. Na 16GB kartě to bude těsné, s 24 GB pohodlné. Náš test je zároveň varováním — pokud model o kousek přeteče VRAM, nezpomalí o pár procent, ale řádově.
Kontext: proč zrovna teď
Dnešní vydání není osamocené. Alibaba model poprvé oznámila už 19. července jako Qwen3.8-Max-Preview — a schytala kritiku právě za to, že k tvrzení „hned za Fable 5" nedodala jediný benchmark, licenci ani model card. Dnešní blog je tedy odpovědí na tuto kritiku a čísla konečně dorazila. Načasování červencového oznámení navíc přišlo jen dva dny poté, co Moonshot AI uvolnila Kimi K3 s 2,8 bilionu parametrů pod otevřenými vahami. Závod čínských laboratoří o největší otevřený model běží naplno — a pro uživatele je to dobrá zpráva bez ohledu na to, kdo zrovna vede.