
Claude Haiku 5.5: nejmenší Claude dostal effort, 1M kontext a agentní výkon za desetinu ceny
Anthropic vydal Haiku 5.5 s nastavitelným effortem a kontextem 1M tokenů. V OSWorld skočil z 15,7 na 72,4 procenta a do 100 tisíc tokenů stojí desetinu ceny Haiku 4.5. Nový tokenizer a povinné reasoning ale část úspory vracejí.
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Anthropic 7. října vydal Claude Haiku 5.5, nejmenší model své aktuální řady. Poprvé v historii Haiku nabízí nastavitelný effort, kontext 1 milion tokenů a výstup až 128 tisíc tokenů, uvádějí release notes Claude API. Podstatnější než parametry je ale výkon. Model, který dosud sloužil hlavně jako levný pomocník na klasifikaci a shrnutí, v řadě agentních testů překonává GPT-6 Luna od OpenAI.
Co se změnilo
Největší skok je v ovládání počítače. V offline části benchmarku OSWorld 2.1 dosáhl Haiku 5.5 podle Anthropicu 72,4 procenta. Předchůdce Haiku 4.5 měl 15,7 procenta, GPT-6 Luna 48,9 procenta. V Terminal-Bench 4.0, který měří práci v příkazové řádce, má nový model 39,2 procenta, zatímco Haiku 4.5 tu nevyřešil nic. V Humanity's Last Exam bez nástrojů vyskočil z 10,2 na 45,9 procenta.
Pro srovnání: větší Sonnet 5.5 má na stejných testech 83,9, respektive 70,6 procenta. Haiku 5.5 tedy střední třídu nenahrazuje. Velkou část jejího výkonu ale přenáší do cenové hladiny malých modelů.
Při promptech do 100 tisíc tokenů stojí milion vstupních tokenů 0,10 dolaru a milion výstupních 0,50 dolaru. Nad touto hranicí je to 0,50 a 2,50 dolaru. Haiku 4.5 stál 1 a 5 dolarů. Ve stejném oznámení Anthropic zlevnil na polovinu cache reads u Sonnetu 5.5, z 0,20 na 0,10 dolaru za milion tokenů.
⚡ Effort a adaptivní thinking
Effort je parametr, kterým vývojář určuje, kolik „přemýšlení“ model před odpovědí vynaloží. Nižší úroveň znamená rychlejší a levnější odpověď, vyšší úroveň víc reasoning tokenů a obvykle lepší výsledek u složitých úloh. Haiku 5.5 nabízí stupně od low po max. Adaptivní thinking znamená, že model si v rámci zvoleného effortu sám určí, jak dlouho bude nad konkrétním dotazem uvažovat.
Kde jsou háčky
Nižší ceník automaticky neznamená levnější provoz. Haiku 5.5 používá nový tokenizer a Simon Willison naměřil, že stejný dlouhý prompt s ním má zhruba 1,25krát víc tokenů než s Haiku 4.5. Reasoning navíc nejde vypnout, výchozí úroveň je medium. Willison to shrnuje tak, že do 100 tisíc tokenů stojí Haiku stejně jako GPT-6 Luna a má lepší benchmarky. Nad touto hranicí ale vychází Luna podstatně výhodněji, protože její příplatek začíná až u 272 tisíc tokenů a je menší.
Vývojáři by si měli ohlídat i kompatibilitu. Kód psaný pro Haiku 4.5 se může rozbít: ruční extended thinking přes parametr budget_tokens vrací chybu 400 a odpovědi mohou začínat bloky thinking, upozorňují release notes.
Anthropic sám model na složité agentní programování nedoporučuje a pro úlohy typu Terminal-Bench odkazuje na Sonnet 5.5 a Opus 5.5. Haiku 5.5 cílí na objemnou práci s jasně ohraničeným zadáním: shrnutí, kompakci kontextu, dotazy do databází, klasifikaci, práci subagentů, zákaznickou podporu a ovládání prohlížeče. Bezpečnostní filtry pro kybernetiku jsou podle firmy přísnější než u Haiku 4.5 a dál blokují penetrační testování.
Co to znamená v praxi
Pro týmy, které stavějí agentní systémy, je Haiku 5.5 hlavně kandidát na subagenta. Orchestrátor na Sonnetu nebo Opusu může delegovat dílčí úlohy na model, který stojí desetinu Haiku 4.5 a v ovládání počítače předčí GPT-6 Luna. Kdo ale pracuje s dokumenty nad 100 tisíc tokenů, měl by si před přechodem spočítat reálné náklady včetně nového tokenizeru.