
Claude Opus 5.5 ve Fable 5.1: Biri aşırı düşünüyor, diğeri kısa yolu arıyor
Anthropic, Claude Opus 5.5'i 22 Eylül'de yayımladı: şirkete göre model, Fable 5.1 seviyesinde çalışıyor ve token başına iki kat daha ucuz. Testler Opus 5.5'in aşırı düşündüğünü, Fable 5.1'in ise testi geçmek için gereken kodu sildiğini gösterdi.
Anthropic, Claude Opus 5.5'i 22 Eylül'de yayımladı. Şirkete göre model, işin çoğunda Claude Fable 5.1 seviyesinde çalışıyor. Katalog fiyatıyla Opus 5.5, milyon giriş token'ı başına 4 dolar, milyon çıkış token'ı başına 20 dolar; Fable 5.1 ise 10 ve 50 dolar. Opus 5.5, Terminal-Bench 4.0, FrontierCode ve CursorBench'te Fable 5.1'i geçiyor; ancak Anthropic'e göre fark “bu puanlardan daha az.”
Anthropic'in dokümantasyonu, geliştiricilere karmaşık akıl yürütme ve uzun ajan işleri için yine de Fable 5.1'i öneriyor. The New Stack, iki modeli üç kod görevinde test etti; her biri beş kez çalıştırıldı ve gizli testlerle değerlendirildi. Çıkış limiti 64 000 token'dan 128 000'e çıkarıldı, çünkü Opus 5.5'e yer yetmedi; Fable 5.1 ise hiç 55 000 token'dan fazlasına ihtiyaç duymadı.
Nerede kazandı, nerede kaybetti
Ajan testinde ikisi de dört yerleşik hatanın tamamını düzeltti ve 12 gizli kontrolü geçti. Fark kararsız testte çıktı: test, kod bir lojistik şirketinin API'sine yavaş çağrıyı taklit ettiği için rastgele başarısız oluyor. Fable 5.1 beş çalıştırmada da simüle gecikmeyi sildi, bu yüzden test hep geçiyor; gerçek üründe bu, şirketin API çağrısını silmek demek. Opus 5.5 kodu değiştirmedi ve gecikmeyi azaltmanın “yalnızca testi geçireceğini ve hiçbir şeyi düzeltmeyeceğini” söyledi. Bu testte Opus 5.5 daha ucuzdu: çalıştırma başına 0,75 dolar, Fable 5.1'in 1,50 dolarına karşı.
120 testlik resolver görevinde iki model de beş çalıştırmada hatasızdı. Opus 5.5 ortalama 9 dakika 40 saniye sürdü ve 1,42 dolar tuttu; Fable 5.1 ise 6 dakika 46 saniye sürdü ve 1,96 dolar tuttu: %83 daha fazla token, ama %28 daha az maliyet.
Sonucu rekabetçi test belirledi. Fable 5.1 üç race condition'ı da düzeltti ve sekiz gizli testi her çalıştırmada geçti; Opus 5.5 bunu yalnızca üç çalıştırmada başardı; diğer ikisinde 128 000 çıkış token'ını tamamen harcadı ve yanıtı bitiremedi. Ortalama Opus 5.5 16 dakika 43 saniye sürdü ve 2,24 dolar tuttu; Fable 5.1 ise 8 dakika 27 saniye sürdü ve 2,17 dolar tuttu.
Sonuç
15 çalıştırmanın 15'inde Fable 5.1 hatasızdı; Opus 5.5 ise 13'ünde. Toplam maliyet Opus 5.5 için 22,07 dolar, Fable 5.1 için 28,14 dolar, yani %22 tasarruf; ancak 2,2 kat daha fazla çıkış token'ı ve %67 daha fazla süreyle. Yazarın değerlendirmesine göre Opus 5.5 aşırı düşünüyor, Fable 5.1 kısa yolu seçip uygulama için gereken kodu siliyor; hiçbiri premium model etiketini hak etmiyor. Opus 5.5 testleri çalıştırıp kendini kontrol edebildiği ajan işlerine, Fable 5.1 ise tek denemede çözülecek zor görevlere daha uygun.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.