Přejít k hlavnímu obsahu

Grok 4.6 dohnal GPT-5.6 v agentních testech. Model SpaceXAI míří na dlouho běžící agenty

Ilustrační obrázek
Společnost xAI (nyní na vlastních stránkách pod značkou SpaceXAI) vydala Grok 4.6. Je to první model této rodiny, který se na složeném indexu Artificial Analysis Intelligence vyrovnal GPT-5.6 od OpenAI — oba mají 61 bodů. Nejdůležitější ale není jednorázové skóre: Grok 4.6 je postavený pro dlouho běžící agenty, kteří sami zkontrolují, co udělali, než postoupí dál.

K čemu je Grok 4.6 vlastně určený

Když si dnes necháte od AI napsat krátkou funkci nebo odpověď na e-mail, rozdíly mezi špičkovými modely skoro nepoznáte. Problém nastává, když má model pracovat desítky minut až hodiny — třeba prohledat neznámou databázi, projít cizí kódovou základnu nebo z nápadu postavit první funkční verzi aplikace. Právě sem xAI míří.

Agent je v řeči AI jednoduše model, který neodpoví a neskončí, ale rozdělí si úkol na kroky a postupně je provádí — čte soubory, spouští příkazy, opravuje vlastní chyby. U krátkých úloh to funguje spolehlivě. U dlouhých se historicky modely „ztrácely“: zapomínaly kontext, motaly se v kruhu nebo považovaly za hotové něco, co hotové nebylo.

Grok 4.6 vznikl přesně proti tomuhle. Podle oficiálního oznámení se model na delších úlohách „začal sám testovat a ověřovat“ — zkontroluje svůj výstup, než postoupí k dalšímu kroku. To je klíčový posun od předchozího Groku 4.5.

Co se změnilo proti Grok 4.5

Největší skok je vidět v agentních benchmarcích. DeepSWE v1.1, který měří schopnost řešit skutečné úkoly z repozitářů, poskočil z 54 na 65,9 procenta. CursorBench z 66,7 na 69,9 procenta a Terminal-Bench, kde model pracuje v příkazové řádce, z 15,7 na 26 procent. Tedy ne „nepatrné vylepšení“, ale u řady testů o desítky procent lepší výsledek.

Důvod je v tréninku. xAI použila delší doplňkový trénink s kurátorovanými generovanými daty pro uvažování a pokročilé technické koncepty a nasadila širší sadu agentních úloh — od znalostní práce přes programování až po specializované prostředí na optimalizaci kernelů nebo webový vývoj.

Srovnání s konkurencí: férový obrázek

Oficiální tabulka srovnává Grok 4.6 s modelem GPT-5.6 Sol od OpenAI a Fable 5 Max od Anthropicu. Výsledky stojí za podrobnější čtení, než naznačuje marketing.

BenchmarkGrok 4.6Grok 4.5GPT-5.6 SolFable 5
AA Intelligence Index61566162
CursorBench v3.269,9 %66,7 %67,2 %70,5 %
DeepSWE v1.165,9 %54 %73 %70 %
Terminal-Bench v3.026 %15,7 %34,6 %34,1 %
GDPVal-AA v21753152617281741
Harvey LAB (Vals)15,8 %12,9 %2,5 %11,3 %

Data: oficiální x.ai. Tučně nejlepší výsledek v řádku.

Co z toho plyne bez růžových brýlí? Grok 4.6 patří do první ligy — vyrovnal GPT-5.6 v souhrnném indexu a vyhrává v ekonomickém benchmarku GDPVal-AA i v právnickém Harvey LAB. Zároveň ale na řadě kódovacích testů stále vede Anthropic (CursorBench, FrontierCode, APEX-Agents) a v terminálových úlohách zůstává xAI znatelně pozadu. Zatím jde o vyrovnání špičky, ne o odskočení od ní.

Cena: kolik Grok 4.6 stojí

Přes API startuje Grok 4.6 na 2 dolarech za milion vstupních tokenů a 6 dolarech za milion výstupních tokenů. K tomu existuje „rychlá“ varianta za dvojnásobek. Při kurzu zhruba 23 korun za dolar to vychází takto:

  • vstup: 2 USD ≈ 46 Kč za milion tokenů (0,2 haléře za tisíc tokenů),
  • výstup: 6 USD ≈ 138 Kč za milion tokenů,
  • rychlá varianta: dvojnásobek, tedy zhruba 92 a 276 Kč.

Pro představu: běžný článek o zhruba 5 000 tokenech by vás na vstupu vyšel na řádově setiny koruny. Skutečné náklady u agentů rostou hlavně na výstupní straně a s délkou úlohy — dlouhý agent, který generuje desítky milionů tokenů, se prodraží právě kvůli 6 dolarům za výstup.

Kde si ho vyzkoušíte

Grok 4.6 je ode dneška dostupný v Cursoru a v Grok Build, tedy prostředí pro tvorbu aplikací s agentem. První týden xAI v obou službách nabízí dvojnásobek zahrnutého využití, takže si ho můžete osahat bez okamžité platby. Přes API je k dispozici i u partnerů jako OpenRouter, Vercel a Cloudflare.

Pro českého vývojáře je podstatné, že žádná z cest není omezená regionem — Cursor i OpenRouter fungují v Česku běžně, platí se v dolarech. Samotný chatovací Grok češtinu zvládá dlouhodobě, takže při zadávání úkolů agentovi čeština není překážka. Zda a kdy se 4.6 dostane i do běžné mobilní aplikace Grok, oznámení nezmiňuje — zatím jde o vydání mířené na vývojáře a agenty.

Co si z toho odnést

Grok 4.6 není přelom ve smyslu nového rekordu ve všech testech. Je to dobré znamení, kam se agentní AI posouvá: modely začínají soutěžit v tom, kdo déle a spolehlivěji odvede práci bez lidského dohledu, ne jen v tom, kdo napíše líp esej. A fakt, že xAI se na souhrnném indexu vyrovnala GPT-5.6 méně než rok po předchozí generaci, ukazuje, jak rychle se dnes mezery mezi špičkou a zbytkem zmenšují.

Je Grok 4.6 dostupný v češtině?

Samotný chatovací Grok češtinu ovládá a není problém mu úkoly zadávat česky. Nový model 4.6 se zatím šíří přes vývojářské kanály (Cursor, Grok Build, API, OpenRouter), kde čeština v zadáních funguje stejně dobře. Oznámení ale nezmiňuje, kdy se 4.6 dostane do běžné mobilní aplikace.

Čím se Grok 4.6 liší od běžného chatovacího modelu?

Je optimalizovaný pro agentní práci — tedy pro úlohy, kde model sám postupuje v mnoha krocích, čte soubory, spouští kód a kontroluje vlastní výstup. U krátkých dotazů rozdíl nepoznáte, u hodinové práce na projektu ano.

Proč je u agentů důležitá cena výstupních tokenů?

Agent při práci generuje řádově víc textu, než přijme jako zadání. Výstupní tokeny jsou třikrát dražší než vstupní (6 vs. 2 USD za milion), takže při dlouhém běhu agenta tvoří právě výstup většinu účtu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.