Společnost Anthropic představila model Claude Sonnet 5.5, druhý přírůstek do své nejnovější generace 5.5 po dříve uvedeném modelu Opus 5.5. Novinka cílí na každodenní inženýrskou praxi, ladění kódu a práci s rozsáhlými dokumenty. Hlavním lákadlem je výrazný mezigenerační posun v úlohách autonomního programování v terminálu i třetinové zrychlení odezvy. Zároveň však tvůrci poprvé do střední třídy svých modelů integrovali přísné kybernetické mantinely, které rizikovější bezpečnostní dotazy nekompromisně přepnou na starší a slabší verzi.
Shrnutí v bodech
- Skok v terminálu: V náročném testu agentního programování Terminal-Bench 4.0 dosáhl Sonnet 5.5 skóre 70,6 % oproti pouhým 10,3 % u předchůdce Sonnet 5.
- Vyšší rychlost a nižší účet: Generování textu je o více než 30 % rychlejší a díky efektivnějšímu slučování nástrojových volání klesají reálné náklady na vyřešený úkol až o 30 %.
- Stejné nominální ceny: V API stojí milion vstupních tokenů 2 dolary, výstupních 10 dolarů a čtení z mezipaměti 0,20 dolaru.
- Bezpečnostní fallback: U rizikovějších úloh z oblasti kyberbezpečnosti systém dotaz automaticky a viditelně přesměruje na starší Sonnet 5.
Skok v terminálu: Když střední třída poráží vlajkovou loď
Zatímco dosavadní Claude Sonnet 5 byl spolehlivým pomocníkem pro běžné programování v editorech, v komplexních úlohách v příkazové řádce často ztrácel dech. V benchmarku Terminal-Bench 4.0, který simuluje samostatné řešení vícekrokových vývojářských zadání v terminálu, dosahoval původní Sonnet 5 skóre pouhých 10,3 %. Nový Sonnet 5.5 v tomto testu zaznamenal 70,6 %, čímž překonal i nedávno uvedený vlajkový model Claude Opus 5.5, který dosáhl 66,4 %.
Výrazný posun ukazují také specializovaná měření ve vývojových prostředích. V testu CursorBench 4.0, který čerpá ze skutečných programátorských relací, vzrostla úspěšnost ze 34,1 % na 55,5 %. V hodnocení FrontierCode 1.1 dosahuje model při maximálním úsilí hodnoty 46,2 % a v rozšířeném režimu až 52,1 %. Vizuální porozumění a dlouhodobé plánování pak tvůrci demonstrují i neobvyklým testem: Sonnet 5.5 je prvním modelem řady Sonnet, který dokázal projít celou hru Pokémon Red pouze na základě předkládaných snímků obrazovky.
Rychlejší generování a reálná úspora na úkol
Anthropic u nového modelu nezměnil základní ceník tokenů pro vývojářské rozhraní API. Ceny zůstávají shodné s předchozí generací:
- Vstupní tokeny: 2 dolary za 1 milion tokenů (pro srovnání: Opus 5.5 stojí 4 dolary)
- Výstupní tokeny: 10 dolarů za 1 milion tokenů (Opus 5.5 vychází na 20 dolarů)
- Čtení z mezipaměti (cache reads): 0,20 dolaru za 1 milion tokenů
- Zápis do mezipaměti (cache writes): 2,50 dolaru za 1 milion tokenů
Podstatný finanční rozdíl však spočívá v efektivitě běhu. Model generuje odpovědi o více než 30 % rychleji a na vyřešení stejného zadání potřebuje méně mezikroků. Dokáže lépe sdružovat volání externích nástrojů a zkracovat délku výstupních úvah. V testech společnosti Slack vyžadoval Sonnet 5.5 na interních úlohách přibližně o 14 % méně výstupních tokenů. Výsledné náklady na jeden vyřešený úkol tak v praxi klesají až o 30 %.
Bezpečnostní brzda: Pád na starší model
Vysoké schopnosti v práci se systémovými nástroji přiměly Anthropic k nasazení obranných mechanismů, které dříve vyhrazoval pouze pro nejvyšší modely. U pokročilých úloh souvisejících s kybernetickou bezpečností zavádí společnost aktivní filtr: pokud systém vyhodnotí požadavek jako potenciálně zneužitelný k útoku, odpověď nezpracuje Sonnet 5.5, ale dotaz viditelně spadne na starší a méně schopný Sonnet 5.
Běžný vývoj softwaru, hledání chyb v aplikacích ani běžná práce s kódem tímto filtrem zasaženy nejsou. Bezpečnostní specialisté z řad obránců sítí budou moci žádat o výjimku v rámci ověřovacího programu Cyber Verification Program. Model navíc obsahuje ochranu proti neoprávněné destilaci vah a rozšiřuje funkci preserved thinking, která svazuje tok uvažování modelu s konkrétním uživatelským účtem a brání extrakci jeho interních postupů.
Znalostní práce a dostupnost
Kromě programování posílil Sonnet 5.5 také v kancelářských a analytických činnostech. V komplexním testu GDPval-AA v2.1, který zahrnuje reálné pracovní úkoly napříč 44 profesemi, dosáhl skóre 1844 bodů, což je téměř na úrovni špičkového modelu Opus 5.5 (1846 bodů) a o čtyři sta bodů výše než u modelu Sonnet 5. Podle raných testů zvládá vytvářet strukturované prezentace či provozní zprávy s minimální potřebou lidských úprav.
Claude Sonnet 5.5 je ode dneška dostupný ve webovém rozhraní Claude, v aplikaci Claude Code i prostřednictvím vývojářského API. V aplikacích je výchozí úroveň uvažování nastavena na střední hodnotu, zatímco v API na vysokou. Rodinu 5.5 má v následujících týdnech doplnit ještě nejmenší a nejlevnější model Claude Haiku 5.5.
Kolik stojí provoz modelu Claude Sonnet 5.5 v API?
Nominální sazba je 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních tokenů. Díky menšímu počtu kroků a kratším výstupům však reálné náklady na úkol klesají až o 30 %.
Jak funguje bezpečnostní fallback při rizikových dotazech?
Pokud bezpečnostní klasifikátor vyhodnotí požadavek v oblasti kyberbezpečnosti jako vysoce rizikový, dotaz automaticky přesměruje na starší model Sonnet 5. Běžné programování a hledání chyb v kódu funguje bez omezení.
Kdy vyjde nejlevnější model Claude Haiku 5.5?
Anthropic oznámil, že odlehčený Haiku 5.5 určený pro velkoobjemové a cenově nejcitlivější aplikace dorazí do nabídky v následujících týdnech.