
Claude Opus 5.5 və Opus 5 düşünmə tapşırıqlarında: daha ucuz, daha sürətli, amma daha yaxşı deyil
Anthropic bildirir ki, Claude Opus 5.5 Opus 5-dən 40% ucuz və 30% sürətlidir. The New Stack hər iki modeli üç düşünmə tapşırığında sınayıb: qənaət özünü doğruldub, sürət iddiası isə özünü doğrultmayıb və cavablar tamamilə eyni olub.
The New Stack Anthropic-in iki modelini, Claude Opus 5.5 və Claude Opus 5-i üç çətin düşünmə tapşırığında müqayisə edib. Nəticə sadədir: yeni model daha ucuz və daha sürətlidir, lakin daha ağıllı deyil. Hər ikisi üç tapşırıqdan ikisini tam həll edib, üçüncüsündə uğursuz olub.
Anthropic nə vəd edir
Şirkətin açıqlamasına görə, Opus 5.5 adi yüklənmələrdə Opus 5-dən 40% ucuzdur və mətni 30%-dən çox daha sürətli yaradır; imkanlarına görə isə Claude Fable 5.1 səviyyəsinə çatmalı, yəni əvvəlki modeli üstələməlidir. API qiyməti də düşüb: bir milyon giriş tokeni 4 dollar, çıxış tokeni isə 20 dollardır, halbuki Opus 5-də bunlar 5 və 25 dollar idi. Endirimin özü yalnız 20% qənaət verir, qalan hissəni model daha az token xərcləməklə təmin etməlidir.
Məntiq şəbəkəsi: eyni cavablar, daha aşağı xərc
Hər iki model Anthropic API-si vasitəsilə eyni sorğularla çağırılıb və standart səy səviyyəsində adaptiv düşünmə rejimində işlədilib; Opus 5.5-də düşünməni söndürmək mümkün deyil. Yeddi mühəndis və 22 ipucundan ibarət məntiq şəbəkəsini hər ikisi 28 xananın hamısı düzgün olmaqla həll edib. Opus 5.5 65 saniyə, 7 573 çıxış tokeni və 0,16 dollar xərcləyib; Opus 5 isə 108 saniyə, 10 621 token və 0,27 dollar xərcləyib. Eyni cavab üçün yeni model 43% daha ucuz olub.
Daş oyunu: eyni nəticə, daha az token
Yaddaşlı daş oyununda hər iki model üç sualın hamısını düzgün cavablandırıb. Birinci oyunçu 200 daşla uduzur, 120-dən 500-ə qədər ölçülər uduzan hallardır, 340-dan böyük ən kiçik uduzan ölçü isə 344-dür. Fərq düşünmə həcmində ortaya çıxıb: Opus 5.5 işi 215 saniyədə, 28 740 token və 0,58 dollar ilə bitirib, Opus 5 isə 624 saniyə, 74 981 token və 1,88 dollar xərcləyib. Bu, eyni cavab üçün 62% az token və 69% aşağı məsrəf deməkdir.
Heç bir modelin həll edə bilmədiyi tapşırıq
Düzgün cavabları 27, 1 695 və 159 019 olan yerləşdirmə işlərinin yenidən sıralanması tapşırığını heç bir model cavablandırmayıb. 48 000 tokenlik çıxış limiti ilə hər ikisi bütün büdcəni düşünməyə sərf edib və cavab verməyib. Limit 128 000-ə qaldırıldıqdan sonra Opus 5 bütün tokenləri tükədib, 25 dəqiqədən çox işləyib və cavabsız dayanıb. Opus 5.5 isə 19 dəqiqədə 112 733 tokendə dayanıb, lakin API cavabı mətn olmadan "imtina" səbəbi ilə bitirib. Sorğuda həssas heç nə yoxdur, müəllif bunu təhlükəsizlik filtrinin səhvi hesab edir.
Praktikada nə deməkdir
Bütün test boyu Opus 5.5 1 701 giriş və 197 046 çıxış tokeni xərcləyib, Opus 5 isə 1 693 və 261 602. Xərc 3,95 dollara qarşı 6,55 dollar olub. Yazma sürəti saniyədə 103,4 tokenə qarşı 93,1 olub, yəni təxminən 11% daha sürətli və şirkətin iddia etdiyi 30%-dən aşağıdır. Tövsiyə aydındır: bu gün Opus 5 işlədənlər Opus 5.5-ə keçərsə, eyni nəticələri daha az pulla və daha az gözləməklə alır. Çıxış tokenləri üçün sərt limit qoymaq lazımdır, çünki hər iki model 20 dəqiqə və daha çox düşünüb heç nə qaytara bilər; sayma tələb edən tapşırıqlarda isə modelə kod icra etmə aləti vermək daha doğrudur.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.