Přejít k hlavnímu obsahu

Zapomeňte na předraženou AI. GLM-5.3-Flash stojí pár korun

AI article illustration for jarvis-ai.cz
Čínská Z.ai představila GLM-5.3-Flash. Jde o první nativně multimodální model řady GLM-5. Model sice disponuje 320 miliardami parametrů, do akce se jich ale dává jen 18 miliard. V programování a agentních úlohách se přibližuje Claude Opus 4.8. A to za zlomek nákladů. Váhy jsou volně ke stažení, takže si je lze provozovat i u nás.

Tajný model, na který přišel internet

GLM-5.3-Flash nebyl pro veřejnost úplně neznámý. Před oficiálním vydáním ho Z.ai testovala anonymně pod krycím jménem ox-alpha na platformách OpenCode a OpenRouter. Chtěla nasbírat zpětnou vazbu. Podle firmy byl nejpopulárnějším modelem týdne. Veškerý provoz ale obsluhovaly čínské AI čipy, což na celý release vrhá nezvyklé světlo.

Když na konci srpna 2026 vyšlo najevo, že za záhadným ox-alpha stojí právě Z.ai, spekulovalo se o vlajkovém modelu. Skutečnost je mnohem zajímavější. Nejde o nejdražší špičku, nýbrž o odlehčenou variantu, která se snaží stlačit náklady na minimum.

Výkon špičky, cena zlomku

Z.ai tvrdí, že GLM-5.3-Flash posouvá hranici poměru výkonu a ceny. Na indexu Artificial Analysis Intelligence Index v4.1.1 dostal skóre 57. Náklady přitom vycházejí na 0,045 dolaru za úkol. Neuvěřitelné je, že dříve stejná úroveň inteligence stála zhruba desetinásobek.

Konkrétní čísla z šesti kódovacích a agentních benchmarků vypadají lákavě. V úloze DeepSWE v1.1 model poráží předchůdce GLM-5.2 skóre 63,4 ku 46,2. V AutomationBench je rozdíl ještě výraznější, a to 48,8 proti 26,2. V interní zkoušce Z.ai Code Bench v1.0 se při maximálním úsilí vyrovná Claude Opus 4.8, konkrétně 29,0 ku 29,5 bodu.

Srovnání se soupeři ukazuje, kam se levná AI posunula. V DeepSWE v1.1 sice GLM-5.3-Flash sleduje GPT-5.6 Terra (69,6) a Gemini 3.7 Flash (65,3), ale nechává za sebou DeepSeek-V4-Vision-Exp (59,3) i Claude Opus 4.8 (58,0). Ve vision testech jako CharXiv Reasoning s nástroji drží skóre 89,4, jen kousek za Gemini 3.7 Flash (88,7).

Architektura: víc inteligence z menšího objemu výpočtů

Základní trik sedí v architektuře. Ve srovnání s řadou GLM-4.5 má GLM-5.3-Flash podobný celkový počet parametrů, tedy 320 miliard proti 355 miliardám. Aktivuje se však jen 18 miliard parametrů místo 32. Počet vrstev klesá z 92 na 45. Dvojnásobně nižší aktivace znamená méně výpočtů na každý token.

Poprvé v řadě GLM se kombinují dva typy pozornosti, takzvaná sparse a linear attention. Lineární pozornost zachycuje lokální závislosti, řídká zase vytahuje globální kontext přes lehký indexer. Novinka zvaná IndexPool při kontextu jednoho milionu tokenů stlačuje čtyři klíčové vektory indexeru do jednoho, čímž dál snižuje paměťovou zátěž.

Firma přidala i techniku Manifold-Constrained Hyper-Connections (mHC) a model učí na korpusu o 30 bilionech tokenů. Proti většímu GLM-5.3 klesá u Flash varianty výpočetní náročnost pozornosti trojnásobně. Velikost KV cache pak klesá 4,4násobně.

Čínské čipy a konec cenové nadvlády

Za pozornost stojí, na čem to celé běží. Z.ai model podle vlastních slov provozuje na velkém clusteru čínských akcelerátorů. Ty jsou omezené pamětí i propustností. Hlavně když mají zvládat kontext až jeden milion tokenů. Proto firma stavěla speciální inference engine nad SGLang, přičemž na optimalizaci kernelů dohlížel agent řízený modelem GLM-5.3.

Výsledek mluví za sebe. Proti základnímu nastavení na stejném hardwaru se koncová propustnost zvýšila trojnásobně. Cena za token se dostala na úroveň běžných NVIDIA GPU. Jinými slovy čínské čipy podle firmy zvládnou provozovat špičkovou inferenci efektivně a levně.

To je signál, že trh s AI infrastrukturou přestává být závislý na jediném výrobci.

Multimodální vidění v kódu i v kanceláři

GLM-5.3-Flash je nativně multimodální a rozumí obrazu, ne jen textu. U vizuálního programování to podle Z.ai rozšiřuje hranice toho, co jde modelovat. Při tvorbě frontendu, her nebo 3D simulace není výstupem jen kód, ale rozhraní, interakce a zážitek uživatele. Chyby často vyplouvou až při renderu či interakci, proto model zvládá sledovat vlastní výstup a zlepšovat ho.

V kancelářské praxi to znamená, že model čte dokumenty, tabulky, prezentace i schůzkové výstupy. Nevyžaduje, aby je uživatel překládal do textových instrukcí. Sady data synthesis pipeline a reinforcement learning podle firmy učí model vyhodnocovat vlastní práci, což vede k lepšímu úsudku o kvalitě a estetice výstupu.

Cena a dostupnost

V oficiálním ceníku stojí GLM-5.3-Flash po úvodní slevě 0,075 dolaru za milion vstupních tokenů, původně 0,15 dolaru. Výstup vyjde na 0,25 dolaru za milion tokenů, dříve 0,50 dolaru. V přepočtu zhruba 23 korunami za dolar to dělá necelé dvě koruny za vstup a necelých šest korun za výstup, obojí za milion tokenů. Ukládání cache je zatím zdarma.

Model dostali uživatelé plánu GLM Coding Plan. Firma jim dává trojnásobnou kvótu oproti GLM-5.3. Multimodální schopnosti využijete v nástroji ZCode, konkrétně skrze funkce Browser Use a Computer Use. Agent sám kliká po webech a ovládá aplikace na ploše, přičemž výstup sleduje vizuálně.

Češi mají jednu velkou výhodu. Váhy modelu jsou volně ke stažení na Hugging Face. Dá se provozovat lokálně. Firma uvádí podporu frameworků SGLang, vLLM a TokenSpeed, čímž se otevřela cesta i pro domácí servery. Přesnou kvalitu češtiny zatím oficiálně nepotvrdila, takže u běhu v našem jazyce bude potřeba vlastní otestování.

Jaký je rozdíl mezi GLM-5.3 a GLM-5.3-Flash?

GLM-5.3-Flash je odlehčená a levnější varianta. Celkovým počtem parametrů (320 miliard) se blíží GLM-5.3. Aktivuje ale jen 18 miliard parametrů a má 45 vrstev místo 92. Hybridní architektura pozornosti snižuje dvojí zátěž. Jde o náročnost výpočtů i velikost KV cache. Proto se hodí do úloh, kde rozhoduje cena a propustnost.

Lze GLM-5.3-Flash provozovat zdarma na vlastním serveru?

Ano, váhy modelu jsou veřejně dostupné na Hugging Face, takže ho lze stáhnout a spustit lokálně. Z.ai momentálně potvrzuje podporu frameworků SGLang, vLLM a TokenSpeed. Provoz ale vyžaduje výkonný hardware, protože jde o model s 320 miliardami parametrů, byť aktivovaných jen 18 miliard parametrů.

Je GLM-5.3-Flash vhodný pro české uživatele?

Z.ai zatím nezveřejnila oficiální hodnocení kvality češtiny, takže přesnou úroveň nelze potvrdit. Pro lokální běh sice existuje podpora frameworků, ale model je nejdřív vhodné otestovat na vlastních textech. Otevřené váhy umožňují nasazení u českých firem i nadšenců. Bez verifikovaných dat o češtině nelze dělat závěry.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.