
Anthropic, Claude Fable'ın görünmez koruma katmanı için özür diledi
Anthropic, damıtma şüphesi taşıyan sorgulara sessizce bozuk yanıt vermenin yanlış bir tercih olduğunu kabul etti; kullanıcılar artık sorgunun Opus 4.8'e aktarıldığını görecek.
Anthropic, yeni modeli Claude Fable 5'i görünmez koruma katmanlarıyla sessizce kısıtladığı için özür diledi; bu uygulama, modeli rakip sistemler geliştirmek için kullanan araştırmacıları ve rakipleri de etkiledi. Şirket rotasını değiştirdiğini ve kısıtlamaların ne zaman devreye girdiği konusunda daha şeffaf olacağını söylüyor — bu, Fable'ın daha fazla sorguyu reddetmesi anlamına gelse bile.
Gizli koruma ve ardından özür
Fable, Anthropic'in Mythos sınıfındaki ilk geniş kullanıma açık model; şirket aylardır bu aileyi kamuya açık sürüm için fazla tehlikeli diye tanımlıyordu. Şirkete göre bu risklerin bir kısmı, belirli "yüksek riskli" sorguları engelleyen koruma katmanlarıyla giderildi. Kısıtlanan alanlardan biri, küçük modellerin büyük modellerin çıktılarıyla eğitilmesi anlamına gelen damıtma. Fable'ın sistem kartında şirket, damıtma girişimi saydığı sorguların yanıtlarını doğrudan değiştirip bozacağını, kullanıcıya ne korumanın devreye girdiğini ne de yanıtın değiştiğini bildireceğini yazmıştı.
Artık Opus 4.8'e yönlendirme
Bu yaklaşım artık değişiyor. Damıtma girişimine benzeyen sorgular, Anthropic'in önceki amiral gemisi Claude Opus 4.8'e yönlendirilecek; şirket bunu X'teki bir gönderide duyurdu. Kullanıcılar durumdan haberdar edilecek: "Bunu her olduğunda göreceksiniz." Mekanizma, Fable'ın biyoloji, kimya ve siber güvenlik gibi diğer yüksek riskli alanlardaki davranışını yansıtıyor: sorgular, uyuşturucu, silah ve benzeri yasaklı içerik kuralları uyarınca tamamen engellenmedikçe Opus 4.8 üzerinden işleniyor. Biyolojide korumalar o kadar geniş ayarlandı ki Fable temel sorularda bile neredeyse kullanılamaz hale geldi — bunu Anthropic sözcüsü Paruul Maheshwary The Verge'e kabul etti.
Araştırmacılardan tepki
Geri adım, Fable'ı damıtma şüphesiyle sessizce sınırlamanın sınır modeli değerlendirmeye çalışan üçüncü tarafları da vurabileceğini söyleyen yapay zekâ araştırma camiasının sert eleştirilerinin ardından geldi. Sistem kartında Anthropic, yeni modellerin yapay zekâ gelişimini hızlandırma yeteneğinin bu tür talepleri hedeflemeyi haklı çıkardığını savunuyor ve "Claude'u rakip modeller geliştirmek için kullanmak hizmet şartlarımızı zaten ihlal ediyor" diyordu. Şirket daha önce DeepSeek gibi Çinli rakiplerini modellerini "endüstriyel" ölçekte damıtmakla suçlamıştı.
X'teki gönderisinde Anthropic yaptığı tercihi de açıkladı: "Görünür korumalar test edilebilir, dolayısıyla sağlam olmaları gerekir ve bu zaman alır. Görünmez korumalar daha dar hedeflenebilir; bu da çok az yanlış pozitifle hızlı çıkmamızı sağlar. Bu nedenle görünmez korumaları seçtik — ve bu yanlış bir tercihti. Hangi korumalara sahip olduğumuzu ve nedenini görebilmelisiniz. Dengeyi tutturamadığımız için özür dileriz."
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.