Přejít k hlavnímu obsahu

AI Arena tento týden: Qwen3-Coder porazil Gemmu v programování, Google vede v češtině

Ilustrační obrázek
Naše pravidelné měření AI Arena z 11. srpna 2026 porovnalo 73 čerstvých běhů a 14 unikátních kombinací modelu a testu. V programování tentokrát zvítězil qwen3-coder:30b, zatímco gemma4:e4b od Googlu nabídla nejnižší odezvu a velmi vyrovnanou rychlost při práci v češtině i angličtině. Výsledky současně ukazují, že lokální AI není jedna kategorie: malý model může být mimořádně rychlý, zatímco větší model potřebuje výrazně více paměti.

AI Arena tento týden: Qwen3-Coder porazil Gemmu v programování, Google vede v češtině

Lokální provoz AI modelů se často popisuje především přes velikost modelu nebo kvalitu odpovědí. Naše měření AI Arena ale ukazuje další důležitý rozměr: jak rychle model začne odpovídat, kolik tokenů zvládne vygenerovat za sekundu a jaké hardwarové nároky při tom má. Právě tyto parametry rozhodují o tom, zda je nástroj příjemný pro každodenní práci, nebo uživatel při každém dotazu čeká.

V aktuálním běhu jsme sledovali pět typů úloh: PHP modul pro Drupal, HTML/JS animaci, Python program s galaxií, český článek, anglický článek a samostatně také generování videa. Nejde o obecný žebříček kvality všech dostupných modelů. Je to naše vlastní měření konkrétních lokálních běhů ve stejném testovacím prostředí, které umožňuje porovnat rychlost a nároky jednotlivých konfigurací.

Qwen3-Coder je nejrychlejší při programování

Nejvýraznější výsledek přinesl model qwen3-coder:30b od Alibaba (Qwen). V testu PHP Drupal modulu dosáhl rychlosti 91,21 tokenu za sekundu. U Pythonu s galaxií to bylo 87,98 tokenu za sekundu a u HTML/JS animace 87,41 tokenu za sekundu.

V programovacích úlohách tak qwen3-coder:30b předstihl gemma4:e4b. Ta v PHP dosáhla 85,62 tokenu za sekundu, v Pythonu 86,1 a v HTML/JS 86,77 tokenu za sekundu. Rozdíl v samotné rychlosti generování není ve všech případech dramatický, ale Qwen má jednu praktickou nevýhodu: potřebuje výrazně více paměti. V měření dosáhla špičková spotřeba VRAM u qwen3-coder:30b hodnoty 3633 MB, zatímco gemma4:e4b pracovala s hodnotou 15 MB u tří testů.

Test qwen3-coder:30b gemma4:e4b Nejlepší výsledek
PHP Drupal modul 91,21 tok/s, TTFT 120 ms 85,62 tok/s, TTFT 53 ms qwen3-coder:30b
HTML/JS animace 87,41 tok/s, TTFT 105 ms 86,77 tok/s, TTFT 61 ms qwen3-coder:30b
Python galaxie 87,98 tok/s, TTFT 110 ms 86,1 tok/s, TTFT 49 ms qwen3-coder:30b

Pro vývojáře to znamená jednoduchou volbu podle vybavení. Pokud je prioritou maximální rychlost generování kódu a počítač má dostatek grafické paměti, qwen3-coder:30b je v našich programovacích testech první volbou. Pokud je důležitější nízká hardwarová náročnost a rychlý začátek odpovědi, gemma4:e4b působí praktičtěji.

Gemma vede v češtině i angličtině

U textových úloh se pořadí mění. Gemma4:e4b byla v našem měření nejrychlejší při českém článku s výsledkem 85,38 tokenu za sekundu a TTFT 57 ms. TTFT, tedy „time to first token“, označuje dobu od zadání požadavku po zobrazení prvního tokenu odpovědi. Pro uživatele je to okamžik, kdy pozná, že model skutečně začal pracovat.

U anglického článku dosáhla gemma4:e4b rychlosti 85,55 tokenu za sekundu. První token se však objevil po 331 ms, tedy později než u českého článku. Celková délka běhu byla 145,4 sekundy a model vygeneroval 3983 tokenů. U českého článku trval běh 46,9 sekundy a vzniklo 3955 tokenů.

Qwen3:32b-q4_K_M byl u stejného testu pomalejší. Český článek zvládl rychlostí 8,97 tokenu za sekundu při TTFT 523 ms. Anglický článek generoval rychlostí 9,11 tokenu za sekundu a na první token čekal 857 ms. Z hlediska rychlosti tak gemma4:e4b v textových úlohách výrazně vede, současně však qwen3:32b-q4_K_M využil přibližně 4565 až 4650 MB VRAM podle testu.

Test Model Rychlost TTFT VRAM
Český článek gemma4:e4b 85,38 tok/s 57 ms 15 MB
Český článek qwen3:32b-q4_K_M 8,97 tok/s 523 ms 4650 MB
Anglický článek gemma4:e4b 85,55 tok/s 331 ms 32 MB
Anglický článek qwen3:32b-q4_K_M 9,11 tok/s 857 ms 4567 MB

Proč je TTFT důležitější, než se může zdát

Rychlost v tokenech za sekundu popisuje především tempo po zahájení generování. TTFT naproti tomu ovlivňuje pocitovou svižnost aplikace. U krátkých dotazů může být důležitější než maximální průběžná rychlost, protože uživatel čeká hlavně na první reakci. U dlouhého článku nebo rozsáhlého programu se více projeví celkový počet tokenů a rychlost jejich generování.

V tomto ohledu má gemma4:e4b velmi silné výsledky. Nejnižší TTFT v měření měla u Pythonu, konkrétně 49 ms, následoval PHP Drupal modul s 53 ms a český článek s 57 ms. Qwen3-Coder:30b byl v programování stále svižný, ale jeho hodnoty byly 105 až 120 ms. Qwen3:32b-q4_K_M se pohyboval mezi 523 a 857 ms.

Pro firmu provozující interního asistenta může nízký TTFT znamenat přirozenější dialog. Pro vývojáře pracující v editoru zase rozhoduje, zda se návrh kódu začne objevovat téměř okamžitě. Samotné číslo ale neříká nic o správnosti odpovědi. Naše data měří výkon, nikoli kvalitu, přesnost nebo bezpečnost vygenerovaného obsahu.

Lokální modely versus cloud pro českého uživatele

Lokální model běží přímo na počítači nebo vlastním serveru. Výhodou je kontrola nad daty a možnost pracovat bez odesílání promptů do vzdálené služby. Nevýhodou jsou hardwarové nároky, instalace a potřeba vybrat vhodný model. Výsledky AI Arena tento rozdíl dobře ilustrují: gemma4:e4b měla v našich záznamech VRAM 15 nebo 32 MB, qwen3-coder:30b 3633 MB a qwen3:32b-q4_K_M až 4650 MB.

Cloudová služba naopak obvykle nevyžaduje vlastní GPU, ale dostupnost, ceny a podmínky zpracování dat se musí ověřit u konkrétního poskytovatele. V dodaných datech nejsou uvedeny ceny, bezplatné tarify ani předplatné v EUR, USD nebo Kč, proto je u těchto modelů nelze poctivě doplňovat. Stejně tak data nepotvrzují samostatnou českou lokalizaci jednotlivých nástrojů. Gemma4:e4b i qwen3:32b-q4_K_M jsme však testovali na českém článku; to potvrzuje test v českém jazyce, nikoli úplnou dostupnost služby pro český trh.

Pro českého uživatele je proto důležité rozlišovat mezi jazykovou použitelností a oficiální dostupností produktu. Lokální běh může být praktický pro práci s citlivými dokumenty, pokud má uživatel odpovídající hardware. Cloud může být jednodušší pro běžné použití, ale z těchto měření nelze určit jeho cenu ani podmínky. Při výběru je rozumné začít typem úlohy: na rychlý český text vychází v našem testu dobře gemma4:e4b, na programování qwen3-coder:30b.

Video test: jiná metrika než u textu

Samostatnou položkou byl MiniMax H3 (local) od MiniMax AI při generování videa. Záznam uvádí 0 tokenů za sekundu, 0 ms TTFT, dobu běhu 2040 sekund a špičkovou VRAM 14 100 MB. Běh je označen jako úspěšný, ale protože neobsahuje žádné tokeny, nelze jeho výsledek přímo porovnávat s textovými a programovacími modely.

U videa se výkon nevyjadřuje stejným způsobem jako u textu. Časový údaj 2040 sekund proto v této tabulce neznamená automaticky horší model než textový systém. Znamená především to, že video generování má jiný výstup a jiné nároky. Pro uživatele je podstatné, že lokální video workflow vyžaduje v našem měření výrazně více VRAM než testované textové modely.

Co si z výsledků odnést

Aktuální týdenní běh AI Arena nepřináší jednoho vítěze pro všechny situace. Qwen3-Coder:30b vyhrál všechny tři programovací testy podle rychlosti generování. Gemma4:e4b vedla v českém a anglickém článku a současně nabídla nejnižší TTFT i nejnižší zaznamenané nároky na VRAM. Qwen3:32b-q4_K_M byl ve všech porovnávaných textových a programovacích úlohách pomalejší.

V datech nejsou měření modelů GPT, Gemini ani Claude, takže s nimi nelze uvést číselné srovnání. Stejně tak nejde z těchto výsledků odvodit kvalita odpovědí, přesnost kódu nebo vhodnost pro produkční nasazení. Pro české firmy a domácí uživatele je ale přínos jasný: před nasazením lokální AI má smysl měřit nejen kvalitu, ale také odezvu, rychlost a paměťové nároky na vlastním typu úloh.

FAQ

Co přesně znamená zkratka TTFT?

TTFT znamená „time to first token“, tedy čas od odeslání požadavku do zobrazení prvního tokenu odpovědi. Nižší hodnota obvykle znamená rychlejší první reakci modelu.

Lze podle měření AI Arena určit, který model píše nejkvalitnější text?

Ne. Naše měření sleduje rychlost, TTFT, délku běhu, počet tokenů a využití VRAM. Nehodnotí věcnou správnost, stylistickou kvalitu ani bezpečnost odpovědí.

Je gemma4:e4b díky výsledkům automaticky vhodná pro každý český počítač?

Ne. Data potvrzují výkon v našem lokálním testu a použití českého článku, nikoli kompatibilitu se všemi počítači nebo oficiální dostupnost modelu na českém trhu. Ceny a tarify v dodaných datech uvedeny nejsou.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.