
Opus 5.5 a GPT-6 Sol vyšly ve stejný den. Frontier výkon zlevnil, ale Opus má skrytý háček
Anthropic i OpenAI vydaly 22. září levnější modely s výkonem dosavadních vlajkových lodí. Opus 5.5 stojí o 40 % méně než Opus 5, GPT-6 Sol a Luna polovinu předchůdců. Vývojáři agentů by si ale měli všimnout, kam Anthropic přesměrovává citlivé dotazy.
Foto: Unsplash / Florian Olivo
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Tento článek vznikl zpracováním veřejně dostupných zdrojů pomocí AI nástrojů. Každý text se snažím přečíst a věcně zkontrolovat, ale ne vždy to zvládnu. Prosím, berte na to ohled a informace si ověřujte v původních zdrojích (níže).
Claude Opus 5.5 a GPT-6 Sol dělají podle svých výrobců práci dosavadních vlajkových lodí za zlomek ceny. Anthropic a OpenAI je vydaly 22. září v rozmezí několika hodin a obě firmy stavěly oznámení hlavně na ceně, ne na novém rekordu v inteligenci.
Opus 5.5: úroveň Fable za cenu Opusu
Podle Anthropicu Opus 5.5 na většině úloh dosahuje úrovně dražšího Claude Fable 5.1 a oproti Opus 5 je na typické zátěži zhruba o 40 % levnější. Úspora se skládá ze dvou částí. Ceník klesl o 20 % na 4 dolary za milion vstupních a 20 dolarů za milion výstupních tokenů, čtení z cache stojí 0,20 dolaru. Zbytek dorovná to, že model potřebuje méně tokenů a výstup generuje o 30 % rychleji.
Největší posun Anthropic uvádí v agentních úlohách. Na Terminal-Bench 4.0, který měří samostatnou práci v příkazové řádce, má Opus 5.5 66,4 % proti 52,3 % u Opus 5. Na GDPval-AA, který simuluje reálnou znalostní práci, vzrostl z 1708 na 1846 bodů Elo. Model je dostupný přes API pod názvem claude-opus-5-5 a také na AWS, Google Cloud a Azure.
GPT-6 Sol a Luna: polovina ceny, polovina chyb
OpenAI vydala dva modely odvozené od GPT-6 Astra, kterou představila začátkem září. Sol je určený pro náročnější práci jako programování, Luna pro velké objemy rutinních úloh typu sumarizace nebo extrakce dat. Oba stojí polovinu předchůdců z řady 5.6. Sol vychází na 2 dolary za milion vstupních a 10 dolarů za milion výstupních tokenů, Luna na 0,10 a 0,50 dolaru.
OpenAI tvrdí, že Sol ve faktických evaluacích dělá zhruba o polovinu méně chyb než předchůdce. Na coding benchmarku DeepSWE v1.1 dosahuje 68,8 % a na OSWorld 2.0, kde model ovládá počítač, se podle OpenAI vyrovná Opus 5 za pětinu nákladů. Srovnání s Opus 5.5 ale oznámení neobsahuje, protože oba modely vyšly ve stejný den.
Háček: Opus 5.5 není vždy Opus 5.5
Pro vývojáře agentů je důležitější detail, na který upozornil The New Stack. Když bezpečnostní klasifikátory Anthropicu vyhodnotí dotaz jako rizikový, požadavek se bez upozornění přesměruje na starší model. Dotazy spojené s kyberbezpečností dostane Opus 4.8, dotazy z biologie nebo vývoje frontier modelů Opus 5.
U jednorázového chatu to nevadí. V agentní smyčce o desítkách kroků ale může jeden krok zpracovat jiný model s jinými schopnostmi než ostatní. Výsledky pak nemusí odpovídat tomu, co ukázaly evaluace. Kdo staví na Opus 5.5 nástroje pro bezpečnostní audit nebo bioinformatiku, měl by si ve vlastních testech ověřit, který model skutečně odpovídá.
Co to znamená v praxi
Oba launche potvrzují trend, který trvá celý rok: cena frontier výkonu padá rychleji, než roste samotná inteligence. Pro firmy, které nasazují agenty ve velkém, je to dobrá zpráva. Úloha, která se před půl rokem nevyplatila, dnes může dávat ekonomický smysl. Benchmarková čísla ale v obou případech pocházejí od výrobců. Nezávislá srovnání na leaderboardech jako Artificial Analysis budou teprve přibývat.