Geri Dön
Siber güvenlik araştırmacıları Anthropic'in Fable modelindeki kısıtlamalardan şikâyetçi
SiTech AI Team2 წთ. საკითხავი

Siber güvenlik araştırmacıları Anthropic'in Fable modelindeki kısıtlamalardan şikâyetçi

Anthropic'in yeni modeli Fable, siber güvenlikle yalnızca dolaylı biçimde ilgili istemleri bile engelliyor. Araştırmacılar filtrelerin sıradan mühendislik işlerini de yakalayıp onları eski bir modele düşürdüğünü söylüyor.

Anthropic, Fable'ı salı günü yayınladı ve onu siber güvenlik modeli Mythos'un herkese açık, sınırlı bir sürümü olarak tanıttı. Modele eşlik eden kısıtlamalar, sistemlere saldırmakla ilgisi olmayan işlerde bile filtrelerin devreye girdiğini söyleyen güvenlik araştırmacılarının ve uzmanlarının tepkisini çekti.

Filtreler isteği değil konuyu işaretliyor

IBM X-Force'ta çalışan güvenlik araştırmacısı Valentina "Chompie" Palmiotti, Fable'ın "siber alanla dolaylı biçimde ilgili olabilecek her isteği reddettiğini, blog yazısı okumak gibi zararsız görevler dahil" yazdı. Bir istem koruma mekanizmalarını tetiklediğinde model sohbeti durduruyor ve kullanıcıya "güvenlik önlemlerinin bu mesajı siber güvenlik veya biyoloji konuları olarak işaretlediğini" bildiriyor. Bir başka araştırmacı da X'te kod incelemesi istemenin bile filtreleri tetiklediğini belirtti.

Kısıtlamalar neden var

Anthropic bu kısıtlamaları Fable'ın kötü amaçlı yazılım geliştirmek veya yazılımı ele geçirmek için kullanılma riskini azaltmak amacıyla koydu; bu, şirketin uzun süredir taşıdığı bir kaygı. Biyoloji kısıtlamaları ise biyolojik silah geliştirme endişesinden doğuyor. Model ayrıca bir koruma tetiklendiğinde Claude Opus 4.8'e düşecek şekilde programlandı. Anthropic ayrıca Cyber Verification Program adlı bir program yürütüyor: onaylanan güvenlik uzmanları Claude'u güvenlik işleri için daha az kısıtlamayla kullanabiliyor. OpenAI'da da Trusted Access for Cyber adlı benzer bir program var.

Mythos ve Project Glasswing

Anthropic, Mythos'u nisan ayında yayınladığında modeli Project Glasswing adlı girişimin kapsamında sınırlı sayıda şirket ve kuruluşa açtı; girişimin amacı kritik yazılım ve altyapıyı korumak. Geçen hafta şirket Mythos'a erişimi 15 ülkedeki yüzlerce kuruluşa genişletti.

Anahtar kelime eşleşmesi, muhakeme değil

Artık yapay zekâ güvenlik girişimi Tolmo'da çalışan siber güvenlik emektarı Matt Suiche, TechCrunch'a şöyle dedi: "Güvenli kod yazmasını isterseniz bunu yazılım mühendisliği iyi uygulamaları değil siber güvenlik işi sayıyor ve düşürülüyorsunuz." Ona göre tetikleyiciler anahtar kelimeye dayanıyor, dolayısıyla siber güvenlik sözlük alanındaki her şey onları harekete geçiriyor. Bu yaklaşımın bu aşamada anlaşılır olduğunu ve kısıtlamaların zamanla gevşetileceğini ekledi: "Böyle bir sürümde fazla insanı yakalamak, azını yakalamaktan iyidir; kısıtlamalar da zamanla gevşetilir." Anthropic, yorum talebine hemen yanıt vermedi.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.