
Claude Opus 5.5 və Fable 5.1: biri həddindən artıq düşünür, digəri qısa yol axtarır
Anthropic Claude Opus 5.5-i 22 sentyabrda buraxdı: şirkətə görə, model Fable 5.1 səviyyəsində işləyir, lakin token üçün iki dəfə ucuzdur. Testlər göstərdi ki, Opus 5.5 çox düşünür, Fable 5.1 isə testdən keçmək üçün lazım olan kodu silir.
Anthropic Claude Opus 5.5-i 22 sentyabrda buraxdı. Şirkətin açıqlamasına görə, model işlərin çoxunda Claude Fable 5.1 səviyyəsində çalışır. Kataloq qiymətinə görə Opus 5.5 milyon giriş tokeni üçün 4 dollar, milyon çıxış tokeni üçün 20 dollar, Fable 5.1 isə 10 və 50 dollardır. Opus 5.5 Fable 5.1-i Terminal-Bench 4.0, FrontierCode və CursorBench-də üstələyir, lakin Anthropic-in sözlərinə görə, fərq «bu ballardan azdır».
Anthropic sənədləri yenə də developerlərə mürəkkəb düşüncə və uzun agent işləri üçün Fable 5.1-i tövsiyə edir. The New Stack hər iki modeli üç kod tapşırığında yoxladı; hər biri beş dəfə işə salındı və gizli testlərlə qiymətləndirildi. Çıxış limiti 64 000 tokendən 128 000-ə qaldırıldı, çünki Opus 5.5-ə yer çatmadı; Fable 5.1 heç vaxt 55 000 tokendən çox tələb etmədi.
Harada qazandı, harada uduzdu
Agent testində hər ikisi dörd quraşdırılmış baqı düzəltdi və 12 gizli yoxlamadan keçdi. Fərq qeyri-sabit testdə üzə çıxdı: o, təsadüfi uğursuz olur, çünki kod nəqliyyat şirkətinin API-sinə yavaş zəngi simulyasiya edir. Fable 5.1 beş işə salmanın hamısında simulyasiya edilmiş gecikməni sildi, buna görə test həmişə keçir; real məhsulda bu, şirkətin API zənginin silinməsi deməkdir. Opus 5.5 kodu dəyişməz saxladı və dedi ki, gecikmənin azaldılması «yalnız testin keçməsinə səbəb olar və heç nəyi düzəltməz». Bu testdə Opus 5.5 daha ucuz oldu: hər işə salma üçün 0,75 dollar, Fable 5.1-in 1,50 dollarına qarşı.
120 testli resolver tapşırığında hər iki model beş işə salmanın hamısında səhvsiz idi. Opus 5.5 orta hesabla 9 dəqiqə 40 saniyə və 1,42 dollar tələb etdi, Fable 5.1 isə 6 dəqiqə 46 saniyə və 1,96 dollar: 83% daha çox token, lakin 28% az xərc.
Nəticəni rəqabət testi həll etdi. Fable 5.1 hər üç race condition-u düzəltdi və hər işə salmada səkkiz gizli testin hamısından keçdi, Opus 5.5 isə bunu yalnız üç işə salmada bacardı; qalan ikisində o, 128 000 çıxış tokenini tamamilə xərclədi və cavabı tamamlaya bilmədi. Orta hesabla Opus 5.5 16 dəqiqə 43 saniyə və 2,24 dollar tələb etdi, Fable 5.1 8 dəqiqə 27 saniyə və 2,17 dollar.
Nəticə
15 işə salmadan Fable 5.1 15 dəfə səhvsiz oldu, Opus 5.5 isə 13 dəfə. Ümumi xərc Opus 5.5 üçün 22,07 dollar, Fable 5.1 üçün 28,14 dollardır, yəni 22% qənaət, lakin 2,2 dəfə çox çıxış tokeni və 67% çox vaxtla. Müəllifin qiymətləndirməsinə görə, Opus 5.5 həddindən artıq düşünür, Fable 5.1 isə qısa yol seçir və tətbiq üçün lazım olan kodu silir; heç biri premium model etiketiə layiq deyil. Opus 5.5 testləri işə salıb özünü yoxlaya bildiyi agent işlərinə daha uyğundur, Fable 5.1 isə bir cəhdlə həll edilməli olan çətin tapşırığa.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.