ARC-AGI-3: Test, který neokecáte znalostmi z internetu
Benchmark ARC-AGI-3 od týmu kolem Françoise Cholleta (autora frameworku Keras) měří něco zásadně jiného než klasické testy. Zatímco většina benchmarků zkouší, co si model zapamatoval z trénovacích dat, ARC-AGI-3 testuje schopnost řešit zcela nové, neznámé problémy — podobně jako IQ test u lidí. Model musí v interaktivním prostředí sám odvodit pravidla hry, naplánovat akce a krok za krokem je provést. Žádné naučené odpovědi, žádné memorování.
Právě proto je výsledek Opus 5 tak výjimečný. Předchozí model Opus 4.8 zvládl na stejném testu jen 1,5 %. GPT-5.6 Sol (Max) od OpenAI — dosavadní lídr — dosáhl 7,8 %. A Fable 5, dosud nejvýkonnější model od Anthropicu, se pohyboval kolem 20 %. Opus 5 se svými 30,2 % je tak nejen první, ale s výrazným odstupem.
Ze 25 veřejných demo prostředí ARC-AGI-3 už jich šest někdo vyřešil. Opus 5 přidal pět dříve nevyřešených prostředí, z toho čtyři na úrovni člověka nebo výš. Na starších verzích benchmarku dosahuje 97,5 % (ARC-AGI-1) a 90,4 % (ARC-AGI-2).
Srovnávací tabulka: Opus 5 versus konkurence
Podívejme se, jak Opus 5 obstál napříč různými benchmarky v porovnání s nejbližšími soupeři:
| Benchmark | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 | Opus 4.8 |
|---|---|---|---|---|
| ARC-AGI-3 | 30,2 % | 7,8 % | ~20 % | 1,5 % |
| Frontier-Bench v0.1 | 43,3 % | 34,4 % | 33,7 % | 21,1 % |
| GDPval-AA v2 (Elo) | 1 861 | 1 736 | 1 747 | — |
| DeepSWE v1.1 | 68,8 % | 72,7 % | 69,7 % | — |
| ARC-AGI-2 | 90,4 % | — | — | — |
Opus 5 vede ve čtyřech z pěti klíčových benchmarků. OpenAI si drží prvenství pouze v DeepSWE (agentní softwarové inženýrství), kde GPT-5.6 Sol těsně vítězí.
Chování, které u AI ještě nikdo neviděl
Výzkumníci z ARC Prize během testování pozorovali něco, co označili za bezprecedentní. Opus 5 samostatně překládal zadání úloh do algebraické notace a formuloval vlastní reflexní rovnice — tedy matematicky popsal své uvažování o tom, jak úlohu řešit. "Jde o chování, které jsme u jazykového modelu dosud neviděli," uvádí tým ARC Prize ve své analýze.
Model také prokázal schopnost postavit si vlastní nástroje, když mu chyběly. V jedné úloze dostal za úkol vytvořit 3D model strojní součásti podle výkresu, ale neměl přímý přístup k obrázku. Opus 5 si proto napsal vlastní pipeline pro počítačové vidění, extrahoval geometrii z pixelů a model kompletně zrekonstruoval. Žádný jiný model to nedokázal ani na pět pokusů.
Cena: Poloviční oproti Fable 5, pro Čechy od 575 Kč měsíčně
Zatímco Fable 5 stojí 10 dolarů za milion vstupních tokenů a 50 za výstupní, Opus 5 drží stejnou cenu jako předchozí Opus 4.8: 5 dolarů za milion vstupních a 25 dolarů za milion výstupních tokenů. V přepočtu na koruny (při aktuálním kurzu ~23 Kč/USD) to znamená zhruba 115 Kč za milion vstupních tokenů a 575 Kč za milion výstupních.
Pro české uživatele je Claude dostupný prostřednictvím Claude Pro za 20 USD měsíčně (~460 Kč), což zahrnuje přístup k Opus 5. Prémiové předplatné Claude Max stojí 100–200 USD měsíčně (2 300–4 600 Kč) a nabízí vyšší limity. Claude podporuje češtinu na velmi slušné úrovni — rozumí jí, odpovídá v ní a poradí si i s českými reáliemi.
| Model | Vstup (USD/1M tokenů) | Výstup (USD/1M tokenů) | Předplatné od |
|---|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ | 20 $ / měsíc (Pro) |
| Claude Fable 5 | 10 $ | 50 $ | 100 $ / měsíc (Max) |
| GPT-5.6 Sol | — | — | 20 $ / měsíc (Plus) |
Opus 5 navíc nabízí Fast Mode, který je 2,5× rychlejší za dvojnásobnou cenu. Pro běžné použití je ale výchozí rychlost plně dostačující. Anthropic také uvádí, že Opus 5 je tokenově efektivnější než starší modely — za stejné peníze vyřídí víc práce.
Opravdová inteligence, nebo trénink na míru?
Ne všichni jsou z výsledků stejně nadšení. Nezávislé testy na soukromém benchmarku Witness výzkumníka Guanghana Ninga ukazují výrazně skromnější zisky. Opus 5 tam dosáhl skóre 43,4 — statisticky nerozlišitelně od Kimi K3 a Fable 5. Zlepšení oproti Opus 4.8 je na Witnessu mnohem menší než na ARC-AGI-3.
To naznačuje, že část skoku na ARC-AGI-3 může být způsobena cíleným tréninkem — Opus 5 vznikl až poté, co se formát ARC-AGI-3 stal veřejně známým. Anthropic mohl anotátory nechat označkovat logické postupy u podobných hlavolamů a posílit model v dovednostech, které benchmark testuje. To ale neznamená, že by model podváděl — jde spíš o to, že se mohl soustředit na typ úloh, který ARC-AGI-3 obsahuje.
Sám Ning později upřesnil, že Opus 5 na Witnessu generalizoval, jen výrazně méně než na ARC-AGI-3. "Je to podobné jako evoluce programovacích benchmarků," vysvětlil. "Nejdřív se všichni trénují na saturací HumanEval, pak přijdou těžší testy."
Co to znamená pro Česko a Evropu
Claude je v Evropě plně dostupný — služby v EU poskytuje Anthropic Ireland Limited. Pro české firmy a vývojáře to znamená, že mohou Opus 5 využívat jak přes webové rozhraní Claude.ai, tak přes API s dodržením evropských předpisů o ochraně dat (GDPR).
V kontextu EU AI Act, který vstoupil v platnost, je důležité, že Anthropic k Opus 5 nezavedl povinnou retenci dat — model je možné používat bez obav o ukládání citlivých informací. Zároveň Opus 5 prošel rozsáhlým bezpečnostním auditem a podle Anthropicu jde o nejlépe "zarovnaný" model v historii firmy — vykazuje nejnižší míru klamavého chování a je nejodolnější vůči zneužití.
Opus 5 také výrazně méně odmítá legitimní požadavky než Fable 5 — bezpečnostní filtry u něj zasahují o 85 % méně často. To ocení zejména vývojáři a výzkumníci, které časté blokace u Fable 5 frustrovaly.
Vědecký výzkum a specializované nasazení
Anthropic označuje Opus 5 za svůj nejschopnější obecně dostupný model pro vědecký výzkum. Oproti Opus 4.8 zaznamenal zlepšení ve všech hodnocených oblastech přírodních věd. Nejvýraznější skok je v organické chemii (+10,2 procentního bodu při odvozování molekulárních struktur ze spektroskopických dat) a v proteinovém inženýrství (+7,7 bodu).
Na druhou stranu, v kyberbezpečnosti za svými sourozenci zaostává. Záměrně nebyl trénován na útočné kybernetické úlohy. Zranitelnosti najde téměř stejně dobře jako Mythos 5, ale jejich zneužití (exploitace) je výrazně horší — což je záměr.
Jaký je rozdíl mezi Claude Opus 5 a Claude Fable 5?
Fable 5 je prémiový "frontier" model Anthropicu s nejvyšší inteligencí, ale za dvojnásobnou cenu. Opus 5 je nová vlajková loď, která se Fable 5 výkonem blíží (a v některých benchmarcích ho i překonává), ale stojí polovinu. Je to model určený pro každodenní použití — od programování přes analytickou práci po vědecký výzkum. Běžný uživatel rozdíl mezi nimi prakticky nepozná.
Je Claude Opus 5 dostupný v češtině?
Ano. Claude rozumí česky na velmi dobré úrovni — zvládá konverzaci, překlady, analýzu českých textů i odpovídání na dotazy týkající se českých reálií. Česká lokalizace není dokonalá jako u specializovaných překladačů, ale pro každodenní práci je plně dostačující. Model je dostupný přes web Claude.ai i mobilní aplikaci.
Co je to ARC-AGI-3 a proč na něm záleží?
ARC-AGI-3 je benchmark vytvořený týmem kolem Françoise Cholleta, který netestuje naučené znalosti, ale schopnost řešit zcela nové, neznámé problémy. Model musí v interaktivním prostředí sám přijít na pravidla a aplikovat je. Jde o nejbližší aproximaci "obecné inteligence", jakou dnes v AI testování máme. Výsledek Opus 5 (30,2 %) je sice rekordní, ale stále hluboko pod lidskou úrovní — cena za kompletní vyřešení ARC-AGI-3 je stále vypsaná a čeká na svého vítěze.