
GPT-6 Sol ile Claude Opus 5.5: sonuç tutarlı değilse ucuzluk ne işe yarar
The New Stack, OpenAI'nin GPT-6 Sol ile Anthropic'in Claude Opus 5.5 modellerini üç zorlu geliştirici testinde beşer kez denedi. Sol yaklaşık altı kat daha ucuza çalıştı ama 15 koşunun üçünde hata yaptı; Opus 5.5 ise hepsinde kusursuzdu.
OpenAI, GPT-6 Sol'u 22 Eylül 2026'da yayımladı ve iş akışı görevlerinde Claude Opus 5'i görev başına maliyetin yüzde 9'una karşılık geçtiğini duyurdu: Sol, Zapier AutomationBench'te yüzde 33,2 alırken Opus 5 yüzde 26,9'da kalıyor. Aynı gün Anthropic, Claude Opus 5.5'i çıkardı; The New Stack'ten Jessica Wachtel de testi bu modele karşı yaptı.
Liste fiyatlarına göre Sol, milyon girdi tokenı için 2 dolar ve milyon çıktı tokenı için 10 dolar istiyor; bu GPT-5.6 Sol'un yarı fiyatı. Opus 5.5 ise 4 ve 20 dolar. Dolayısıyla Sol daha fazla token harcasa bile yine daha ucuza gelebilir.
Üç test, her biri beş koşu
İlk tur berabere bitti: iki model de Python ile yazılmış bir faturalama servisine yerleştirilen üç hatayı düzeltti, 40 başarısız CI işini sınıflandırdı ve sahte bir SDK hakkındaki 20 soruyu tek bir metot uydurmadan yanıtladı. Daha zor sürümler, 3.664 satırlık kesinti raporu ve 120 gizli testle değerlendirilen bir spesifikasyon uygulaması da berabere bitti. Modelleri yalnızca tekrarlı koşular ayırdı.
Her iki model de aynı istemlerle, kendi en yüksek çaba ayarında API üzerinden çağrıldı; her test beş kez koşuldu. CI sınıflandırmasında model 40 başarısız iş için yeniden deneme, engelleme ya da nöbetçi çağırma kararı veriyor; kesinti günlükleri beş servisten gelen 3.664 satırı ve yedi soruyu kapsıyor; çözücü spesifikasyonu ise iki sayfalık metinden kod çalıştırmadan bağımlılık çözücü yazmayı istiyor.
Sayılar ne gösteriyor
OpenAI'nin iddiasına en yakın test olan CI sınıflandırmasında iki model de 5'te 5 yaptı. Opus 5.5 koşu başına ortalama 1 dakika 27 saniye, 11.127 çıktı tokenı ve 0,24 dolar harcadı; Sol 18 saniye, 1.143 token ve 0,02 dolar, yani maliyetin yüzde 8'i. Bu, OpenAI'nin reklamını yaptığı yüzde 9 ile örtüşüyor.
Kesinti günlüklerinde tablo değişti: Opus 5.5 beş koşunun hepsinde kusursuzdu, Sol yalnızca ikisinde. Sol iki kez aynı müşteriyi atladı; bu müşterinin ödemesi, yeniden deneme başarılı olduktan 52 saniye sonra onaylanmıştı. Bir koşuda da 28 yerine 27 başarısız ödeme saydı. Opus 5.5 ortalama 6 dakika 44 saniye, 53.308 çıktı tokenı ve 1,68 dolar harcadı; Sol 1 dakika 41 saniye, 7.073 token ve 0,30 dolar, aynı günlüğü yüzde 25 daha az girdi tokenıyla okudu.
Çözücü spesifikasyonunda Opus 5.5 her koşuyu, Sol beşte dördünü geçti: 78. satırda kalan bir kapanış parantezi modülü içe aktarımda çökertti ve 120 testin tamamı düştü. Opus 5.5 ortalama 9 dakika 40 saniye, 70.687 çıktı tokenı ve 1,42 dolar; Sol 6 dakika 28 saniye, 21.435 token ve 0,22 dolar harcadı.
Daha ucuz, ama her zaman doğru değil
15 koşunun tamamında Opus 5.5 kusursuzdu, Sol 12 kez. Sol'un 15 koşusu toplam 2,68 dolar tuttu, yani Opus 5.5'in 16,72 dolarının yaklaşık yüzde 16'sı. Wachtel kullanımı hatanın bedeline göre ayırıyor: çıktıyı bir insanın ya da test kümesinin denetlediği yüksek hacimli işlerde Sol, bu fiyatlarla iki kez koşup karşılaştırılabilir; yanlış yanıtın pahalı olduğu ve kimsenin denetlemediği durumlarda ise Opus 5.5. Sol'un hataları incelemeden sıyrılan türden: iade listesinden düşen bir müşteri ya da içe aktarılmayan bir dosya.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.