Geri Dön
Claude Opus 5.5 kod işini başlatmakla kalmayıp bitirmeyi hedefliyor
SiTech AI Team2 წთ. საკითხავი

Claude Opus 5.5 kod işini başlatmakla kalmayıp bitirmeyi hedefliyor

Anthropic, Claude 5.5 ailesinin ilk modeli Claude Opus 5.5'i tanıttı; model geliştirme yaşam döngüsünün daha büyük bölümünü kapsıyor. Uzmanlara göre asıl sorun, "bitti" ile "doğru"nun aynı şey olmaması.

Anthropic'in yeni Claude 5.5 ailesinin ilk modeli Claude Opus 5.5, daha hızlı bir kod tamamlayıcıdan çok, bir görevi tasarım spesifikasyonu yazmaktan hata ayıklamaya, kod üretmekten testlere kadar geliştirme yaşam döngüsünün büyük bölümünde taşıyabilen bir ajan olarak konumlandırılıyor. The New Stack'e göre vurgu, işe daha hızlı başlamak değil, işi bitirmek.

Döngüyü kapatan ajan

Geliştiricilerin anlattığı değişim mimari nitelikte. HasData kurucu ortaklarından Sergey Ermakovich, terminalin "artık geliştiricinin üretilmiş kodu yapıştırdığı bir yer olmadığını — terminalin modelin çalışma alanının parçası hâline geldiğini" söylüyor. Model komut çalıştırabildiği, hataları inceleyebildiği, dosyaları değiştirebildiği ve sonucu doğrulayabildiği için işi yarım bırakıp mühendise geri vermek yerine döngüyü kendisi kapatıyor. Ona göre bu, küçük ama tamamlanmış görevleri çok daha değerli kılıyor: başarısız bir testi düzelt, bir bağımlılığı güncelle, doğrula ve sonrakine geç.

Migrasyonlar, denetimler ve fiyat

Anthropic, Opus 5.5'in tüm kod tabanını kapsayan migrasyon ve denetimler gibi uzun, dağınık işlerde özellikle güçlü olduğunu iddia ediyor. Bir erken test kullanıcısının 200.000 satırlık kod tabanını üç saatten kısa sürede denetleyip düzelttiği, Opus 5'in ise 20 saatten fazla ve 2,5 kat daha fazla token harcadığı belirtiliyor. Şirket içi bir testte Opus 5.5 ve Fable 5.1, HAProxy'yi C'den Rust'a yeniden yazdı ve regresyon testlerinin neredeyse tamamını geçti; Opus 5.5 12 saat yerine 9,5 saatte tamamladı ve %51 daha ucuza geldi. Fiyatlandırma milyon giriş tokenı için 4 dolar, milyon çıkış tokenı için 20 dolar; bu Opus 5'ten %20 düşük, önbellek okuma fiyatı ise %60 indirildi.

"Tamamlandı" ile "doğru" aynı şey değil

The New Stack'e konuşan uzmanlar yeteneği olumlu karşılıyor ama darboğazın artık üretim değil doğrulama olduğunu vurguluyor. Bağımsız SRE ve yapay zekâ güvenilirlik mimarı Akash Thakur, bu düzeydeki modellerin bir projeyi bitirilebilir parçalara bölmekte gerçekten iyi olduğunu, ancak "tamamlandı" ile "doğru"nun aynı şey olmadığını söylüyor: bitmiş görünen görev ekibe sonradan pahalıya mal olur; bu yüzden kazanç insanı devre dışı bırakmak değil, onu kod yazmaktan kodu doğrulamaya taşımak. Abbyy yapay zekâ stratejisi başkan yardımcısı Maxime Vermeir, otomatik tamamlama döneminin bittiğini ve artık bir Jira kaydının tamamen kapatılmasının beklendiğini söylüyor.

Güvenlik önlemleri ve yönlendirme

Anthropic, Opus 5.5'in yayından önce Frontier Design ve METR dahil dış kuruluşlarca test edildiğini ve şirketin en kapsamlı uyum testinde bugüne kadarki en güçlü model olduğunu söylüyor. Önlemler devreye girdiğinde istekler şeffaf biçimde başka bir modele yönlendiriliyor: siber güvenlik görevlerinin çoğu Opus 4.8'e, biyoloji ve öncü LLM geliştirme talepleri Opus 5'e gidiyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.