Geri Dön
Claude Opus 5.5 ile Opus 5 akıl yürütmede: daha ucuz ve hızlı, ama daha iyi değil
SiTech AI Team3 წთ. საკითხავი

Claude Opus 5.5 ile Opus 5 akıl yürütmede: daha ucuz ve hızlı, ama daha iyi değil

Anthropic, Claude Opus 5.5'in Opus 5'ten %40 ucuz ve %30 hızlı olduğunu söylüyor. The New Stack iki modeli üç akıl yürütme sorusunda karşılaştırdı: tasarruf gerçek çıktı, hız iddiası tutmadı ve yanıtlar tamamen aynıydı.

The New Stack, Anthropic'in iki modelini, Claude Opus 5.5 ile Claude Opus 5'i üç zor akıl yürütme sorusunda karşılaştırdı. Sonuç basit: yeni model daha ucuz ve daha hızlı, ama daha akıllı değil. İkisi de üç sorudan ikisini tam çözdü, üçüncüsünde başarısız oldu.

Anthropic ne vaat ediyor

Şirkete göre Opus 5.5, tipik iş yüklerinde Opus 5'ten %40 daha ucuz ve çıktıyı %30'dan fazla daha hızlı üretiyor; yetenek olarak Claude Fable 5.1 seviyesine ulaşması, yani önceki modeli geçmesi bekleniyor. API fiyatı da düştü: bir milyon giriş token'ı 4, çıkış token'ı 20 dolar; Opus 5'te bunlar 5 ve 25 dolardı. İndirim tek başına %20 tasarruf sağlıyor, kalanı modelin daha az token harcamasından gelmeli.

Mantık tablosu: aynı yanıtlar, daha düşük maliyet

İki model de Anthropic API'si üzerinden aynı istemlerle çağrıldı ve varsayılan çaba düzeyinde uyarlanabilir düşünme modunda çalıştı; Opus 5.5'te düşünmeyi kapatmak mümkün değil. Yedi mühendis ve 22 ipucundan oluşan mantık tablosunu ikisi de 28 hücrenin tamamı doğru olacak şekilde çözdü. Opus 5.5 65 saniye, 7.573 çıkış token'ı ve 0,16 dolar harcadı; Opus 5 ise 108 saniye, 10.621 token ve 0,27 dolar harcadı. Aynı yanıt için yeni model %43 daha ucuz çıktı.

Taş oyunu: aynı sonuç, çok daha az token

Hafızalı taş oyununda iki model de üç sorunun üçünü doğru yanıtladı. İlk oyuncu 200 taşla kaybediyor, 120 ile 500 arasındaki büyüklükler kaybedilen durumlar ve 340'ın üzerindeki en küçük kaybedilen büyüklük 344. Fark düşünme hacminde ortaya çıktı: Opus 5.5 işi 215 saniyede, 28.740 token ve 0,58 dolarla bitirdi; Opus 5 ise 624 saniye, 74.981 token ve 1,88 dolar harcadı. Bu, aynı yanıt için %62 daha az token ve %69 daha düşük maliyet demek.

İki modelin de çözemediği soru

Doğru yanıtları 27, 1.695 ve 159.019 olan dağıtım işlerini yeniden sıralama sorusunu iki model de yanıtlayamadı. 48.000 token'lık çıkış sınırında ikisi de bütçenin tamamını düşünmeye harcadı ve hiç yanıt vermedi. Sınır 128.000'e çıkarıldığında Opus 5 tüm token'ları tüketti, 25 dakikadan fazla çalıştı ve yanıt vermeden durdu. Opus 5.5 ise 19 dakikada 112.733 token'da durdu, ancak API metinsiz bir reddetme gerekçesiyle yanıtı sonlandırdı. İstemde hassas hiçbir şey yok, yazar bunu güvenlik filtresi hatası sayıyor.

Pratikte ne anlama geliyor

Tüm test boyunca Opus 5.5 1.701 giriş ve 197.046 çıkış token'ı kullandı; Opus 5 ise 1.693 ve 261.602. Maliyet 3,95 dolara karşı 6,55 dolar oldu. Yazma hızı saniyede 103,4 token'a karşı 93,1 oldu, yani yaklaşık %11 daha hızlı ve şirketin iddia ettiği %30'un altında. Tavsiye açık: bugün Opus 5 kullananlar Opus 5.5'e geçerek aynı sonuçları daha az parayla ve daha az bekleyerek alıyor. Katı bir çıkış token sınırı koymak yine de gerekli, çünkü iki model de 20 dakika ve üzeri düşünüp hiçbir şey döndüremiyor; sayma gerektiren sorularda ise modele kod çalıştırma aracı vermek daha doğru.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.