Přejít k hlavnímu obsahu

Claude Sonnet 5.5 drtí předchůdce v kódu. Při riziku ale spadne na starou AI

Ilustrační obrázek

Společnost Anthropic představila model Claude Sonnet 5.5, druhý přírůstek do své nejnovější generace 5.5 po dříve uvedeném modelu Opus 5.5. Novinka cílí na každodenní inženýrskou praxi, ladění kódu a práci s rozsáhlými dokumenty. Hlavním lákadlem je výrazný mezigenerační posun v úlohách autonomního programování v terminálu i třetinové zrychlení odezvy. Zároveň však tvůrci poprvé do střední třídy svých modelů integrovali přísné kybernetické mantinely, které rizikovější bezpečnostní dotazy nekompromisně přepnou na starší a slabší verzi.

Shrnutí v bodech

  • Skok v terminálu: V náročném testu agentního programování Terminal-Bench 4.0 dosáhl Sonnet 5.5 skóre 70,6 % oproti pouhým 10,3 % u předchůdce Sonnet 5.
  • Vyšší rychlost a nižší účet: Generování textu je o více než 30 % rychlejší a díky efektivnějšímu slučování nástrojových volání klesají reálné náklady na vyřešený úkol až o 30 %.
  • Stejné nominální ceny: V API stojí milion vstupních tokenů 2 dolary, výstupních 10 dolarů a čtení z mezipaměti 0,20 dolaru.
  • Bezpečnostní fallback: U rizikovějších úloh z oblasti kyberbezpečnosti systém dotaz automaticky a viditelně přesměruje na starší Sonnet 5.

Skok v terminálu: Když střední třída poráží vlajkovou loď

Zatímco dosavadní Claude Sonnet 5 byl spolehlivým pomocníkem pro běžné programování v editorech, v komplexních úlohách v příkazové řádce často ztrácel dech. V benchmarku Terminal-Bench 4.0, který simuluje samostatné řešení vícekrokových vývojářských zadání v terminálu, dosahoval původní Sonnet 5 skóre pouhých 10,3 %. Nový Sonnet 5.5 v tomto testu zaznamenal 70,6 %, čímž překonal i nedávno uvedený vlajkový model Claude Opus 5.5, který dosáhl 66,4 %.

Výrazný posun ukazují také specializovaná měření ve vývojových prostředích. V testu CursorBench 4.0, který čerpá ze skutečných programátorských relací, vzrostla úspěšnost ze 34,1 % na 55,5 %. V hodnocení FrontierCode 1.1 dosahuje model při maximálním úsilí hodnoty 46,2 % a v rozšířeném režimu až 52,1 %. Vizuální porozumění a dlouhodobé plánování pak tvůrci demonstrují i neobvyklým testem: Sonnet 5.5 je prvním modelem řady Sonnet, který dokázal projít celou hru Pokémon Red pouze na základě předkládaných snímků obrazovky.

Rychlejší generování a reálná úspora na úkol

Anthropic u nového modelu nezměnil základní ceník tokenů pro vývojářské rozhraní API. Ceny zůstávají shodné s předchozí generací:

  • Vstupní tokeny: 2 dolary za 1 milion tokenů (pro srovnání: Opus 5.5 stojí 4 dolary)
  • Výstupní tokeny: 10 dolarů za 1 milion tokenů (Opus 5.5 vychází na 20 dolarů)
  • Čtení z mezipaměti (cache reads): 0,20 dolaru za 1 milion tokenů
  • Zápis do mezipaměti (cache writes): 2,50 dolaru za 1 milion tokenů

Podstatný finanční rozdíl však spočívá v efektivitě běhu. Model generuje odpovědi o více než 30 % rychleji a na vyřešení stejného zadání potřebuje méně mezikroků. Dokáže lépe sdružovat volání externích nástrojů a zkracovat délku výstupních úvah. V testech společnosti Slack vyžadoval Sonnet 5.5 na interních úlohách přibližně o 14 % méně výstupních tokenů. Výsledné náklady na jeden vyřešený úkol tak v praxi klesají až o 30 %.

Bezpečnostní brzda: Pád na starší model

Vysoké schopnosti v práci se systémovými nástroji přiměly Anthropic k nasazení obranných mechanismů, které dříve vyhrazoval pouze pro nejvyšší modely. U pokročilých úloh souvisejících s kybernetickou bezpečností zavádí společnost aktivní filtr: pokud systém vyhodnotí požadavek jako potenciálně zneužitelný k útoku, odpověď nezpracuje Sonnet 5.5, ale dotaz viditelně spadne na starší a méně schopný Sonnet 5.

Běžný vývoj softwaru, hledání chyb v aplikacích ani běžná práce s kódem tímto filtrem zasaženy nejsou. Bezpečnostní specialisté z řad obránců sítí budou moci žádat o výjimku v rámci ověřovacího programu Cyber Verification Program. Model navíc obsahuje ochranu proti neoprávněné destilaci vah a rozšiřuje funkci preserved thinking, která svazuje tok uvažování modelu s konkrétním uživatelským účtem a brání extrakci jeho interních postupů.

Znalostní práce a dostupnost

Kromě programování posílil Sonnet 5.5 také v kancelářských a analytických činnostech. V komplexním testu GDPval-AA v2.1, který zahrnuje reálné pracovní úkoly napříč 44 profesemi, dosáhl skóre 1844 bodů, což je téměř na úrovni špičkového modelu Opus 5.5 (1846 bodů) a o čtyři sta bodů výše než u modelu Sonnet 5. Podle raných testů zvládá vytvářet strukturované prezentace či provozní zprávy s minimální potřebou lidských úprav.

Claude Sonnet 5.5 je ode dneška dostupný ve webovém rozhraní Claude, v aplikaci Claude Code i prostřednictvím vývojářského API. V aplikacích je výchozí úroveň uvažování nastavena na střední hodnotu, zatímco v API na vysokou. Rodinu 5.5 má v následujících týdnech doplnit ještě nejmenší a nejlevnější model Claude Haiku 5.5.

Kolik stojí provoz modelu Claude Sonnet 5.5 v API?

Nominální sazba je 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních tokenů. Díky menšímu počtu kroků a kratším výstupům však reálné náklady na úkol klesají až o 30 %.

Jak funguje bezpečnostní fallback při rizikových dotazech?

Pokud bezpečnostní klasifikátor vyhodnotí požadavek v oblasti kyberbezpečnosti jako vysoce rizikový, dotaz automaticky přesměruje na starší model Sonnet 5. Běžné programování a hledání chyb v kódu funguje bez omezení.

Kdy vyjde nejlevnější model Claude Haiku 5.5?

Anthropic oznámil, že odlehčený Haiku 5.5 určený pro velkoobjemové a cenově nejcitlivější aplikace dorazí do nabídky v následujících týdnech.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.