
Anthropic, Claude Sonnet 5.5 isteklerini siber korumalar yüzünden Sonnet 5'e yönlendirebilir
Anthropic'e göre Claude Sonnet 5.5, üç aşamalı siber sınıflandırıcıları ve yedek modele geçişi taşıyan ilk Sonnet modeli. Engellenen siber istekler Sonnet 5'e yönlendiriliyor ve bu, API üzerinden çalışan geliştiricilerin kurallarını değiştiriyor.
Yönlendirme ucuz katmana indi
Anthropic bu hafta Claude Sonnet 5.5'i yayımladı. Bu, şirketin en güçlü sistemleri için geliştirdiği üç aşamalı siber sınıflandırıcıları ve yedek modele geçişi taşıyan ilk Sonnet modeli. Böylece sınıflandırıcı tabanlı yönlendirme, birçok ekibin üretim iş yüklerini çalıştırdığı katmana girdi.
Anthropic'e göre Sonnet 5.5 modellerinin yetenek sınırını ileri taşımıyor, ancak siber güvenlik becerilerinde Opus 5 ile karşılaştırılabilir düzeyde. Terminal-Bench 4.0'da %70,6 alırken Opus 5.5 %66,4'te kalıyor. Siber filtreler kapalıyken ExploitBench'in 410 çalıştırmasının 178'inde tam keyfi kod yürütmeye ulaştı ve Irregular'ın CyScenarioBench testinde görevlerin %46,1'ini tamamladı; Sonnet 5'te bu oran %0,7'ydi.
Üç aşamalı denetim
Filtreleme üç aşamada çalışıyor: modelin iç aktivasyonlarını okuyan bir probe, doğrudan Sonnet 5.5 üzerinde çalışan hafif bir sınıflandırıcı ve probe'un kararını tartarak konuşmanın engellenip engellenmeyeceğine karar veren ayrı bir eğitilmiş LLM sınıflandırıcısı. Anthropic, sınıflandırıcıların zararlı siber istekleri Opus 5 ile karşılaştırılabilir oranda yakaladığını, ancak Sonnet 5.5 siber güvenlikte Opus 5 ve Fable 5.1'den zayıf olduğu için daha az agresif jailbreak koruması seçtiğini söylüyor. Kullanıcılar Sonnet 5'e kıyasla meşru siber güvenlik işleri dahil daha fazla ret yanıtı beklemeli.
Engellenen siber istekler ve belirli ML hızlandırıcılarında kernel çalışması gibi sınır LLM geliştirmeye bağlı dar bir istek kümesi Sonnet 5'e yönlendiriliyor. Biyoloji, konvansiyonel silahlar ve anti-damıtma engelleri isteği yedek model olmadan sonlandırıyor ve Anthropic'e göre bu engeller yanıtları gizlice değiştirmiyor.
API'de yedek modele geçiş elle açılıyor
Anthropic'in kendi uygulamaları engellenen siber istekleri Sonnet 5'e otomatik gönderiyor, ancak API geliştiricileri bu geçişi kendileri açmak zorunda ve diğer platformlar engellenen istekleri farklı ele alabilir. Geçiş açık değilse engellenen istek yalnızca durur, dolayısıyla Sonnet 5'ten Sonnet 5.5'e geçmek düz bir model değişimi değildir. Siber politika kaynak kodda güvenlik açığı keşfini hâlâ serbest bırakıyor ve güvenli kodlama akışlarını koruyor, ancak derlenmiş ikili dosyalarda bunu engelliyor. Destek dokümantasyonuna göre kontroller modelin okuduğu her şeyi inceliyor: belleği, bağlayıcı içeriğini, web arama sonuçlarını ve dosyaları.
Yedek model ve prompt enjeksiyonu
Anthropic'in kodlama ortamı testlerinde Sonnet 5.5'e gönderilen isteklerin %25'i siber engel tetiklendikten sonra Sonnet 5 tarafından işlendi; buna çoğu kez diskleri silme veya dosyaları kaldırma yönündeki enjekte edilmiş talimatların sınıflandırıcıyı tetiklemesi yol açtı. Yeniden yönlendirilen isteklerin %12,01'i ele geçirildi; Sonnet 5.5'in kendisi ise işlediği 5.901 isteğin yalnızca dördünde.
Anthropic, yanlış pozitifleri azaltmak için Sonnet 5.5'in sınıflandırıcılarını hâlâ ayarladığını ve genişletilmiş Cyber Verification Program kapsamında doğrulanmış savunmacılara daha az kısıtlamayla erişim vermeyi planladığını söylüyor. Sonnet 5.5 çıkış anında bu programa dahil değil.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.