Přejít k hlavnímu obsahu

Claude Opus 5 drtí konkurenci v testu opravdové inteligence: 4× lepší než GPT-5.6 Sol, za poloviční cenu

Ilustrační obrázek pro jarvis-ai.cz
Anthropic právě vydal Claude Opus 5 — a rovnou přepsal žebříček benchmarku, který měří skutečnou inteligenci. Na ARC-AGI-3 dosáhl skóre 30,2 %, zatímco dosavadní lídr GPT-5.6 Sol od OpenAI získal jen 7,8 %. To není drobný náskok, ale čtyřnásobný rozdíl. Aby toho nebylo málo, Opus 5 stojí polovinu ceny Fable 5 a jako první AI model v historii začal úlohy samostatně překládat do algebraického zápisu. Co se přesně stalo a co to znamená pro běžné uživatele i firmy — včetně Česka?

ARC-AGI-3: Test, který neokecáte znalostmi z internetu

Benchmark ARC-AGI-3 od týmu kolem Françoise Cholleta (autora frameworku Keras) měří něco zásadně jiného než klasické testy. Zatímco většina benchmarků zkouší, co si model zapamatoval z trénovacích dat, ARC-AGI-3 testuje schopnost řešit zcela nové, neznámé problémy — podobně jako IQ test u lidí. Model musí v interaktivním prostředí sám odvodit pravidla hry, naplánovat akce a krok za krokem je provést. Žádné naučené odpovědi, žádné memorování.

Právě proto je výsledek Opus 5 tak výjimečný. Předchozí model Opus 4.8 zvládl na stejném testu jen 1,5 %. GPT-5.6 Sol (Max) od OpenAI — dosavadní lídr — dosáhl 7,8 %. A Fable 5, dosud nejvýkonnější model od Anthropicu, se pohyboval kolem 20 %. Opus 5 se svými 30,2 % je tak nejen první, ale s výrazným odstupem.

Ze 25 veřejných demo prostředí ARC-AGI-3 už jich šest někdo vyřešil. Opus 5 přidal pět dříve nevyřešených prostředí, z toho čtyři na úrovni člověka nebo výš. Na starších verzích benchmarku dosahuje 97,5 % (ARC-AGI-1) a 90,4 % (ARC-AGI-2).

Srovnávací tabulka: Opus 5 versus konkurence

Podívejme se, jak Opus 5 obstál napříč různými benchmarky v porovnání s nejbližšími soupeři:

BenchmarkClaude Opus 5GPT-5.6 SolClaude Fable 5Opus 4.8
ARC-AGI-330,2 %7,8 %~20 %1,5 %
Frontier-Bench v0.143,3 %34,4 %33,7 %21,1 %
GDPval-AA v2 (Elo)1 8611 7361 747
DeepSWE v1.168,8 %72,7 %69,7 %
ARC-AGI-290,4 %

Opus 5 vede ve čtyřech z pěti klíčových benchmarků. OpenAI si drží prvenství pouze v DeepSWE (agentní softwarové inženýrství), kde GPT-5.6 Sol těsně vítězí.

Chování, které u AI ještě nikdo neviděl

Výzkumníci z ARC Prize během testování pozorovali něco, co označili za bezprecedentní. Opus 5 samostatně překládal zadání úloh do algebraické notace a formuloval vlastní reflexní rovnice — tedy matematicky popsal své uvažování o tom, jak úlohu řešit. "Jde o chování, které jsme u jazykového modelu dosud neviděli," uvádí tým ARC Prize ve své analýze.

Model také prokázal schopnost postavit si vlastní nástroje, když mu chyběly. V jedné úloze dostal za úkol vytvořit 3D model strojní součásti podle výkresu, ale neměl přímý přístup k obrázku. Opus 5 si proto napsal vlastní pipeline pro počítačové vidění, extrahoval geometrii z pixelů a model kompletně zrekonstruoval. Žádný jiný model to nedokázal ani na pět pokusů.

Cena: Poloviční oproti Fable 5, pro Čechy od 575 Kč měsíčně

Zatímco Fable 5 stojí 10 dolarů za milion vstupních tokenů a 50 za výstupní, Opus 5 drží stejnou cenu jako předchozí Opus 4.8: 5 dolarů za milion vstupních a 25 dolarů za milion výstupních tokenů. V přepočtu na koruny (při aktuálním kurzu ~23 Kč/USD) to znamená zhruba 115 Kč za milion vstupních tokenů a 575 Kč za milion výstupních.

Pro české uživatele je Claude dostupný prostřednictvím Claude Pro za 20 USD měsíčně (~460 Kč), což zahrnuje přístup k Opus 5. Prémiové předplatné Claude Max stojí 100–200 USD měsíčně (2 300–4 600 Kč) a nabízí vyšší limity. Claude podporuje češtinu na velmi slušné úrovni — rozumí jí, odpovídá v ní a poradí si i s českými reáliemi.

ModelVstup (USD/1M tokenů)Výstup (USD/1M tokenů)Předplatné od
Claude Opus 55 $25 $20 $ / měsíc (Pro)
Claude Fable 510 $50 $100 $ / měsíc (Max)
GPT-5.6 Sol20 $ / měsíc (Plus)

Opus 5 navíc nabízí Fast Mode, který je 2,5× rychlejší za dvojnásobnou cenu. Pro běžné použití je ale výchozí rychlost plně dostačující. Anthropic také uvádí, že Opus 5 je tokenově efektivnější než starší modely — za stejné peníze vyřídí víc práce.

Opravdová inteligence, nebo trénink na míru?

Ne všichni jsou z výsledků stejně nadšení. Nezávislé testy na soukromém benchmarku Witness výzkumníka Guanghana Ninga ukazují výrazně skromnější zisky. Opus 5 tam dosáhl skóre 43,4 — statisticky nerozlišitelně od Kimi K3 a Fable 5. Zlepšení oproti Opus 4.8 je na Witnessu mnohem menší než na ARC-AGI-3.

To naznačuje, že část skoku na ARC-AGI-3 může být způsobena cíleným tréninkem — Opus 5 vznikl až poté, co se formát ARC-AGI-3 stal veřejně známým. Anthropic mohl anotátory nechat označkovat logické postupy u podobných hlavolamů a posílit model v dovednostech, které benchmark testuje. To ale neznamená, že by model podváděl — jde spíš o to, že se mohl soustředit na typ úloh, který ARC-AGI-3 obsahuje.

Sám Ning později upřesnil, že Opus 5 na Witnessu generalizoval, jen výrazně méně než na ARC-AGI-3. "Je to podobné jako evoluce programovacích benchmarků," vysvětlil. "Nejdřív se všichni trénují na saturací HumanEval, pak přijdou těžší testy."

Co to znamená pro Česko a Evropu

Claude je v Evropě plně dostupný — služby v EU poskytuje Anthropic Ireland Limited. Pro české firmy a vývojáře to znamená, že mohou Opus 5 využívat jak přes webové rozhraní Claude.ai, tak přes API s dodržením evropských předpisů o ochraně dat (GDPR).

V kontextu EU AI Act, který vstoupil v platnost, je důležité, že Anthropic k Opus 5 nezavedl povinnou retenci dat — model je možné používat bez obav o ukládání citlivých informací. Zároveň Opus 5 prošel rozsáhlým bezpečnostním auditem a podle Anthropicu jde o nejlépe "zarovnaný" model v historii firmy — vykazuje nejnižší míru klamavého chování a je nejodolnější vůči zneužití.

Opus 5 také výrazně méně odmítá legitimní požadavky než Fable 5 — bezpečnostní filtry u něj zasahují o 85 % méně často. To ocení zejména vývojáři a výzkumníci, které časté blokace u Fable 5 frustrovaly.

Vědecký výzkum a specializované nasazení

Anthropic označuje Opus 5 za svůj nejschopnější obecně dostupný model pro vědecký výzkum. Oproti Opus 4.8 zaznamenal zlepšení ve všech hodnocených oblastech přírodních věd. Nejvýraznější skok je v organické chemii (+10,2 procentního bodu při odvozování molekulárních struktur ze spektroskopických dat) a v proteinovém inženýrství (+7,7 bodu).

Na druhou stranu, v kyberbezpečnosti za svými sourozenci zaostává. Záměrně nebyl trénován na útočné kybernetické úlohy. Zranitelnosti najde téměř stejně dobře jako Mythos 5, ale jejich zneužití (exploitace) je výrazně horší — což je záměr.

Jaký je rozdíl mezi Claude Opus 5 a Claude Fable 5?

Fable 5 je prémiový "frontier" model Anthropicu s nejvyšší inteligencí, ale za dvojnásobnou cenu. Opus 5 je nová vlajková loď, která se Fable 5 výkonem blíží (a v některých benchmarcích ho i překonává), ale stojí polovinu. Je to model určený pro každodenní použití — od programování přes analytickou práci po vědecký výzkum. Běžný uživatel rozdíl mezi nimi prakticky nepozná.

Je Claude Opus 5 dostupný v češtině?

Ano. Claude rozumí česky na velmi dobré úrovni — zvládá konverzaci, překlady, analýzu českých textů i odpovídání na dotazy týkající se českých reálií. Česká lokalizace není dokonalá jako u specializovaných překladačů, ale pro každodenní práci je plně dostačující. Model je dostupný přes web Claude.ai i mobilní aplikaci.

Co je to ARC-AGI-3 a proč na něm záleží?

ARC-AGI-3 je benchmark vytvořený týmem kolem Françoise Cholleta, který netestuje naučené znalosti, ale schopnost řešit zcela nové, neznámé problémy. Model musí v interaktivním prostředí sám přijít na pravidla a aplikovat je. Jde o nejbližší aproximaci "obecné inteligence", jakou dnes v AI testování máme. Výsledek Opus 5 (30,2 %) je sice rekordní, ale stále hluboko pod lidskou úrovní — cena za kompletní vyřešení ARC-AGI-3 je stále vypsaná a čeká na svého vítěze.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.