Přejít k hlavnímu obsahu

Claude Opus 5 napsal rovnici, kterou žádná AI před ním nesestavila. V ARC-AGI-3 je 4× lepší než GPT-5.6 Sol

Ilustrační obrázek pro jarvis-ai.cz
Claude Opus 5 od Anthropicu dosáhl 30,2 % v benchmarku ARC-AGI-3 — téměř čtyřnásobek dosavadního rekordu GPT-5.6 Sol (7,8 %). A během testu se stalo něco, co výzkumníci z ARC Prize nikdy předtím neviděli: model sám od sebe napsal algebraickou rovnici 4_center = 2×axis − 5_center, kterou popsal geometrickou symetrii prostředí, v němž se pohyboval. Žádný pokyn k matematice nedostal. Žádný jiný model to před ním neudělal.

ARC-AGI-3: Test, který AI neumí "natrénovat nazpaměť"

Většina benchmarků, které dnes AI firmy ukazují v tiskových zprávách, testuje znalosti — umí model odpovědět na otázku, napsat kód, přeložit text? ARC-AGI-3 je postavený úplně jinak. Je to interaktivní prostředí bez instrukcí, bez jazyka a bez předchozích znalostí. Model do něj vstoupí jako hráč do neznámé hry: musí zkoumat, učit se pravidla za pochodu a vymýšlet efektivní strategii — přesně to, čemu psychologové říkají fluidní inteligence.

Benchmark vznikl v březnu 2026 na konferenci Y Combinator v San Franciscu a jeho výsledky byly zdrcující: lidé vyřešili 100 % prostředí, nejlepší AI model tehdy zvládl 0,37 %. O čtyři měsíce později tu máme 30,2 %. To je skok, který v AI benchmarkingu nemá obdoby.

Jak se měří "opravdová" inteligence

ARC-AGI-3 používá metriku RHAE (Relative Human Action Efficiency, vyslovuje se "rej"). Funguje jednoduše — a neúprosně. Pokud člověk vyřeší prostředí na 10 akcí a AI na 100, získá (10/100)² = 1 %. Pokud AI použije 30 akcí, má (10/30)² = 11,1 %. Teprve při 20 akcích dostane 25 %.

Ta druhá mocnina je klíčová: zdvojnásobení počtu akcí nesníží skóre na polovinu, ale na čtvrtinu. Model, který "zkusí všechno", získá téměř nulu — i kdyby nakonec prostředí vyřešil. Benchmark tak trestá přesně tu slabinu, na které dosud AI systémy stály: spoléhání na hrubou výpočetní sílu místo rychlého pochopení problému.

Prostředí jsou navržena tak, aby testovala pouze základní kognitivní schopnosti, které mají už kojenci — rozpoznávání objektů, fyzikální intuici, chápání prostorových vztahů. Žádná encyklopedická znalost, žádná matematika, žádný jazyk.

Rovnice, která změnila výklad výsledku

Ve 23. akci jednoho z prostředí Opus 5 spontánně vygeneroval algebraický zápis: 4_center = 2×axis − 5_center. Je to formální rovnice odrazu v prostoru — popisuje vztah mezi středem objektu, osou symetrie a jeho zrcadlovou pozicí. ARC Prize ji označila za první explicitní reflexní rovnici, jakou kdy jakýkoliv frontier model v jejich analýze vytvořil.

Proč na tom záleží? Model nedostal žádný pokyn "použij matematiku". V prostředí nebyla žádná slova, žádné vzorce. Opus 5 si zjevně vytvořil interní symbolickou reprezentaci pozorovaného prostoru — jako by si přeložil, co vidí, do formálního jazyka, ve kterém dokáže lépe uvažovat. Tohle chování se nápadně podobá tomu, jak lidé řeší neznámé problémy: pojmenujeme si je, abstrahujeme, hledáme pravidelnosti.

ARC Prize sama ve svém oficiálním vyhodnocení uvedla, že náskok Opus 5 na ARC-AGI-3 přímo přičítá silnějšímu logickému uvažování, které umožňuje "autonomnější průzkum, plánování a provádění" v neznámých prostředích.

Co Opus 5 konkrétně dokázal

Z 25 veřejných testovacích prostředí ARC-AGI-3 jich Opus 5 vyřešil šest. Pět z nich — ar25, ft09, lp85, r11l a s5i5 — žádný model před ním nikdy neporazil. Čtyři z těchto pěti byly vyřešeny na úrovni lidské efektivity nebo lépe, tedy se stejným nebo menším počtem akcí než nejlepší lidští testeři. Devatenáct prostředí zůstává nevyřešeno.

Pro srovnání: předchůdce Opus 5 z řady Fable dosáhl přibližně 20 %, GPT-5.6 Sol na maximální úrovni uvažování 7,8 %. Opus 5 přitom běžel pouze na nastavení High (ne na maximálním Max), protože testovací okno před vydáním bylo krátké.

Na starších benchmarcích z rodiny ARC-AGI je obraz podobný: ARC-AGI-1: 97,5 %, ARC-AGI-2: 90,4 % (na Max). Cena za úlohu: $0,70 na ARC-AGI-1 a $2,06 na ARC-AGI-2 — mírně vyšší než předchozí špička, ale stále konkurenceschopné.

Srovnání: Opus 5 vs konkurence na ARC-AGI-3

Model ARC-AGI-3 ARC-AGI-2 ARC-AGI-1 Úroveň uvažování
Claude Opus 5 30,2 % 90,4 % 97,5 % High (ARC-AGI-3)
Anthropic Fable (třída) ~20 % High
GPT-5.6 Sol 7,8 % Max

Poznámka: Opus 5 běžel na nastavení High, GPT-5.6 Sol na Max. Rozdíl v nastavení uvažování sice hraje roli, ale ani při vyrovnání úrovní by se propast mezi 30,2 % a 7,8 % nezavřela. Jde o rozdíl 3,87násobku — ne o drobný posun.

Drobný háček: Witness benchmark ukazuje střízlivější obrázek

Výzkumník Guanghan Ning otestoval Opus 5 na svém benchmarku Witness — sadě interaktivních logických her postavených na podobném principu jako ARC-AGI-3, ale s jinými mechanikami. Výsledky byly méně oslnivé: Opus 5 získal 43,4 ± 3,2 bodu, což je statisticky nerozlišitelné od Kimi K3 (42,8 ± 1,9) a Fable 5 (43,8 ± 9,7). Oproti Opus 4.8 (34,8) sice došlo ke zlepšení, ale zdaleka ne tak dramatickému jako na ARC-AGI-3.

Nejzajímavější je chování modelu na různých typech hádanek. U klasického puzzle, které se podobá známým herním mechanikám, Opus 5 před první akcí formuloval skrytá pravidla a zahrál téměř optimální řešení. Žádný průzkum — model evidentně žánr znal. Naopak u nejnovějšího puzzle s neobvyklou kombinací mechanik skóroval hůř než Opus 4.8.

Tohle je podstata sporu, který teď v AI komunitě rezonuje: naučil se Opus 5 skutečně lépe uvažovat, nebo jen lépe rozpoznává vzory, na kterých byl trénován? Odpověď zatím nikdo nezná — a sám Anthropic veřejně nevysvětlil, co přesně za skokem na ARC-AGI-3 stojí.

Co to znamená pro Česko a Evropu?

Claude Opus 5 je plně dostupný pro české uživatele — češtinu zvládá na výborné úrovni, ať už jde o konverzaci, psaní textů nebo technickou dokumentaci. Pro předplatitele Claude Pro ($20/měsíc, cca 460 Kč) a Max (od $100/měsíc, cca 2 300 Kč) je model k dispozici v rámci běžného chatu. Vývojáři ho mohou využívat přes API za $5 za milion vstupních tokenů a $25 za milion výstupních tokenů.

Pro srovnání: Fable 5, nejsilnější model Anthropicu pro dlouhodobé agenty, stojí dvojnásobek ($10/$50 za milion tokenů). Opus 5 tak představuje nejlepší poměr cena/výkon pro komplexní úlohy vyžadující logické uvažování.

Z pohledu evropské regulace je klíčové, že modely s prokazatelně silnějším reasoningem — jako Opus 5 — zvyšují laťku pro to, co EU AI Act považuje za "vysoce rizikové" nasazení. Čím schopnější model, tím větší odpovědnost za jeho použití. Pro české firmy, které zvažují nasazení AI do kritických procesů, to znamená nutnost pečlivého posouzení rizik a dokumentace — ale také příležitost využít špičkovou technologii dostupnou v češtině.

Kde je hranice mezi učením a uvažováním?

ARC-AGI-3 vznikl právě proto, aby tuhle otázku pomohl zodpovědět. Jeho autoři — včetně Françoise Cholleta, tvůrce populární knihovny Keras — jsou opatrní: ani 100% skóre by neznamenalo AGI (obecnou umělou inteligenci). Znamenalo by to jen, že AI dokáže stejně efektivně jako člověk zvládat nové interaktivní prostředí. To je důležitý, ale jen dílčí krok.

Skutečná otázka zní: dá se benchmark, který testuje schopnost učit se nové věci, sám "naučit"? Výsledky z Witness benchmarku naznačují, že ano — alespoň částečně. Když model na známém typu puzzle hraje optimálně bez jediného průzkumného tahu, těžko tomu říkat "fluidní inteligence". Je to excelentní rozpoznávání vzorů.

Ale ta rovnice. 4_center = 2×axis − 5_center. Tu si model nevytáhl z trénovacích dat — sestavil ji na místě, pro konkrétní situaci, kterou předtím nikdy neviděl. To není pattern matching. To začíná vypadat jako něco jiného.

A přesně proto je 30,2 % na ARC-AGI-3 tou nejzajímavější metrikou roku 2026. Ne proto, že je to velké číslo. Ale proto, že otevírá otázky, na které zatím nikdo nezná odpovědi.

Je Claude Opus 5 dostupný zdarma?

Zdarma je k dispozici pouze základní model Claude Haiku. Opus 5 je součástí placených tarifů Pro ($20/měsíc) a Max (od $100/měsíc), případně přes API za $5/$25 za milion vstupních/výstupních tokenů. Pro nárazové použití je API nejflexibilnější — za pár korun získáte přístup ke špičkovému modelu.

Co přesně znamená RHAE a proč se počítá s druhou mocninou?

RHAE (Relative Human Action Efficiency) porovnává počet akcí, které AI potřebuje k vyřešení prostředí, s počtem akcí člověka. Druhá mocnina poměru (lidské akce / AI akce)² zajišťuje, že neefektivní postupy jsou tvrdě penalizovány — zdvojnásobení počtu akcí sníží skóre na čtvrtinu. Díky tomu benchmark odolává brute-force přístupům, kdy by model "zkusil všechno".

Jak si Claude Opus 5 stojí v češtině oproti GPT-5.6?

Oba modely zvládají češtinu velmi dobře, ale liší se v silných stránkách. Claude Opus 5 vyniká v logickém uvažování, analýze a strukturovaném psaní — české texty z něj působí přirozeně a stylisticky čistě. GPT-5.6 Sol má navrch v rychlosti generování a širší kreativitě. Pro technické a analytické úlohy v češtině je Opus 5 momentálně silnější volbou.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.