Anthropic vydal Claude Sonnet 5.5 a ponechal mu stejné tokenové sazby jako Sonnetu 5. Podle firmy nová verze generuje výstup o více než 30 % rychleji než předchůdce. Je dostupná na všech platformách Anthropicu i přes Amazon Web Services, Google Cloud a Microsoft Azure.
Nižší náklady v testech díky menší spotřebě tokenů
Za milion vstupních tokenů stojí Sonnet 5.5 dva dolary, za milion výstupních tokenů deset dolarů. Samostatnou položkou ceníku je čtení z cache: za milion takto načtených tokenů činí sazba 0,20 dolaru. Žádná z těchto tří tokenových sazeb se proti Sonnetu 5 nemění.
Nižší náklady na dokončení úkolu Anthropic spojuje s množstvím spotřebovaných tokenů, nikoli se snížením jejich jednotkové ceny. V jeho testech byly náklady na jeden úkol až o 30 % nižší než u předchůdce. Firma tento výsledek vysvětluje tím, že Sonnet 5.5 ke stejné práci obvykle potřeboval méně tokenů.
Srovnání v terminálu a rozdíly mezi nastaveními
V testu Terminal-Bench 4.0 zveřejnil Anthropic pro Sonnet 5.5 výsledek 70,6 %, zatímco Sonnet 5 získal 10,3 % a Opus 5.5 dosáhl 66,4 %. Benchmark podle firmy hodnotí, jak model zvládá složité profesní úkoly v příkazové řádce, jejichž dokončení vyžaduje více kroků. Výsledek Opusu 5.5 pochází z nastavení Xhigh; právě při této úrovni dosáhl tento model svého nejlepšího skóre v uvedeném testu.
V GDPval-AA v2.1 uvádí Anthropic skóre 1844 pro Sonnet 5.5, 1449 pro Sonnet 5 a 1846 pro Opus 5.5. K výsledkům připojuje informaci o podmínkách měření: Artificial Analysis testovala GDPval-AA i AA-Briefcase na předběžném nasazení Sonnetu 5.5. To obsahovalo chybu, která mohla zhoršovat odpovědi při požadavcích na strukturovaný výstup. Podle Anthropicu již byla tato chyba opravena.
U FrontierCode firma upozorňuje na horší výsledek Sonnetu 5.5 při nastavení Max než při Xhigh. Test posuzuje, zda lze změnu kódu přijmout bez lidských úprav, a do hodnocení zahrnuje také dodržení rozsahu zadání: zásahy mimo něj penalizuje. Podle Anthropicu model při Max častěji spouštěl kontrolu kódu, při které byla práce rozdělena mezi subagenty. Cognition zkoumala dva případy, v nichž tento postup vedl k vypršení časového limitu nebo k nadbytečným úpravám, a tím k nižšímu skóre.
Interní ukázka přípravy desetisnímkové prezentace
Pro práci s firemními podklady Anthropic popsal interní test sestavení provozního přehledu. Vstup tvořily čtvrtletní výsledkové materiály veřejně obchodované společnosti a přepisy souvisejících hovorů. K těmto podkladům model dostal také šablonu prezentace, přičemž zadání požadovalo přehled o deseti snímcích. Firma hodnotila už první vytvořený návrh: podle jejího popisu jej dva experti označili za připravený k odeslání bez dalších úprav.
Výchozí uvažování a nastavení pro přechod
Na Claude Platform je nová verze dostupná pod identifikátorem claude-sonnet-5-5. Výchozí úroveň uvažování se přitom liší podle prostředí, v němž vývojář nebo uživatel s modelem pracuje. V Claude Code a aplikacích Claude je nastavena na Medium, zatímco Claude Platform používá jako výchozí úroveň High.
Anthropic popisuje rozdíl mezi úrovněmi prostřednictvím rychlosti odpovědí, spotřeby tokenů a průběhu kontroly práce. Při nižším nastavení model odpovídá rychleji a spotřebuje méně tokenů. Vyšší nastavení mu naopak ponechává více prostoru pro uvažování a důkladnější kontrolu toho, co zpracoval.
Zvláštní podmínka přechodu se týká vývojářů, kteří dosud používali Sonnet s vypnutým uvažováním. Před migrací na Sonnet 5.5 musí tuto konfiguraci změnit a zvolit nové nastavení between_tools. Jeho dokumentovanou vlastností je zachování vypnutého úvodního uvažování modelu; právě toto nastavení mají při přechodu použít místo dosavadní volby.
Součástí vydání je také rozšíření mechanismu preserved thinking. Záznam uvažování se jeho prostřednictvím váže k účtu, na kterém vznikl. Změna se týká zejména situací, kdy se konverzace přesouvají mezi různými účty. Zahrnuje i přepnutí účtu během již probíhající relace v Claude Code.
Omezení rizikovějších kyberbezpečnostních úkolů
Anthropic oznámil, že rizikovější kyberbezpečnostní úkoly budou ze Sonnetu 5.5 viditelně přepínány na Sonnet 5. Běžné hledání a opravy chyb v kódu mají zůstat dostupné. Pro odstupňovaný přístup k pokročilejším schopnostem firma teprve plánuje otevřít rozšířený Cyber Verification Program.



