
Sonnet 5.5 a GPT-6.1 Sol: střední třída dohání vlajkové lodě za zlomek ceny
Týden po Opus 5.5 a GPT-6 Sol přišlo další kolo. Claude Sonnet 5.5 se na agentních benchmarcích blíží Opusu, GPT-6.1 Sol z DevDay se podle OpenAI vyrovná Astře v programování za pětinu ceny. Obojí stojí 2 a 10 dolarů za milion tokenů.
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Claude Sonnet 5.5 a GPT-6.1 Sol stojí shodně 2 dolary za milion vstupních a 10 dolarů za milion výstupních tokenů. Podle čísel svých výrobců přitom dělají práci, na kterou byl ještě před týdnem potřeba dražší model. Anthropic vydal Sonnet 5.5 28. září, OpenAI představila GPT-6.1 Sol o den později na konferenci DevDay. Navazují tak na Opus 5.5 a GPT-6 Sol, které vyšly 22. září.
Sonnet 5.5: skok hlavně v agentních úlohách
Největší rozdíl oproti Sonnet 5 ukazuje Anthropic na Terminal-Bench 4.0, kde model samostatně pracuje v příkazové řádce. Sonnet 5 tam měl 10,3 %, Sonnet 5.5 má 70,6 %. To je dokonce víc než 66,4 % u dražšího Opus 5.5, i když na jiných testech Opus vede. Na CursorBench 4.0, který měří práci v editoru Cursor, vzrostl výsledek z 34,1 na 55,5 % a na GDPval-AA, simulaci znalostní práce, ze 1449 na 1844 bodů Elo.
Model generuje výstup o víc než 30 % rychleji a podle Anthropicu potřebuje až o 30 % méně tokenů na úlohu. Firma ho staví jako levnější volbu pro dobře vymezené úlohy, opravy chyb a tvorbu dokumentů, zatímco Opus zůstává pro dlouhé a otevřené práce. V API je dostupný jako claude-sonnet-5-5, včetně možnosti zero data retention.
GPT-6.1 Sol: Astra v programování za pětinu ceny
OpenAI tvrdí, že GPT-6.1 Sol na coding benchmarku DeepSWE v1.1 dosahuje úrovně vlajkové GPT-6 Astra zhruba za pětinu nákladů a o 6,4 procentního bodu překonává GPT-6 Sol z minulého týdne. Na OSWorld 2.0, kde model ovládá počítač, zaostává za Astrou o 2,1 bodu při sedmině ceny. Míra faktických chyb při nízkém reasoning effort klesla z 11,4 na 7,7 %. Model je v ChatGPT Work, Codexu a v API jako gpt-6.1-sol, cachovaný vstup stojí 0,10 dolaru.
Co dál přinesl DevDay
Z více než dvaceti oznámení na DevDay stojí za zmínku tři. Dots jsou stále běžící agenti, kteří mají převzít opakující se povinnosti. Zatím jsou jen pro plány Pro a Business Premium. Ultrafast je placený rychlostní režim s generováním až 300 tokenů za sekundu, osmkrát rychleji než standard. A Agents API nově umí computer use, takže agenti postavení přes API mohou ovládat software stejně jako člověk.
Co z toho plyne
Za dva týdny tak oba hlavní hráči přecenili celou nabídku. Střední třída za 2 a 10 dolarů dnes podle výrobců zvládá agentní programování na úrovni, která byla v létě vyhrazena nejdražším modelům. Všechna čísla ale pocházejí z interních evaluací a oba modely nemají přímé vzájemné srovnání. Pro výběr mezi nimi zatím platí jediné spolehlivé pravidlo: otestovat je na vlastních úlohách.