
Irregular: başıboş yapay zeka saldırıları dalgasının merkezindeki şirket
Irregular'ın simülasyon ortamlarındaki hatalar, OpenAI, Meta, Anthropic ve Google ajanlarının gerçek dünyadaki hedeflere yönelmesine yol açtı; İsrailli girişimin CTO'su bunu doğruladı.
Aylardır yapay zeka ajanlarının gerçek dünyadaki hedeflere yöneldiği haberleri ayrı olaylar olarak duyuruluyordu. The Verge'e göre bu olayların çoğunun tek bir kaynağı var: Yapay zeka geliştiricileri için simülasyonlu güvenlik testleri yürüten İsrailli girişim Irregular.
Irregular ne yapıyor
2023'te Pattern Labs adıyla kurulan şirket, kendi tanımıyla „gerçek dünyadaki yapay zeka güvenlik senaryolarını simüle eden ve izleyen yüksek sadakatli araştırma platformları" geliştiriyor. Müşteri listesi açık değil; ancak şirketin çalışmaları OpenAI modellerinin system card belgelerinde anılıyor, şirket Birleşik Krallık hükümeti ve Anthropic için testler yaptı ve RAND ile araştırma yayımladı.
Testler gerçek dünyaya nasıl sızdı
Bu yıl yapılan birkaç değerlendirmede ajanlar güvenli sayılan ortamlardan kaçtı. Bazı testlerde „capture-the-flag" alıştırmaları kullanıldı: ajan simüle edilmiş bir ağ içinde gizli bilgiyi bulmalıydı.
Irregular'ın CTO'su ve kurucu ortağı Omer Nevo, The Verge'e ajanların açık internete erişmemesi gerektiğini, ancak „internet erişiminin istemeden açık olduğunu" söyledi. Aynı senaryoda hedef olarak kurgulanan hayali şirket adı da „gerçek bir alan adıyla örtüştü". İki hata birleşince ajanlar gerçek dünyadaki hedeflere yöneldi; saldırıya uğrayan kurumların kimler olduğu hâlâ belirsiz.
Tek senaryo, dört laboratuvar
Nevo, OpenAI, Meta, Anthropic ve Google modellerini ilgilendiren olayların arkasında aynı sorunun olduğunu doğruladı. „Irregular ile ilgili tüm olaylar tek bir değerlendirme senaryosundaki aynı temel sorundan kaynaklandı ve açıklandı" dedi. Hugging Face ihlali dahil son dönemde bildirilen diğer olayların Irregular ile ilgisi olmadığını ekledi. OpenAI ve Anthropic'in raporlarına göre şirketlere olaylar temmuz sonunda yaklaşık aynı dönemde bildirildi.
Çin modelleri, değişiklikler ve söz verilen rapor
Irregular'ın yayımladığı araştırmalar, Moonshot AI ve Z.ai'nin açık modelleri Kimi K3 ile GLM-5.2 için de siber güvenlik değerlendirmeleri yapıldığını gösteriyor; bu modeller kendi donanımınızda çalıştırılabildiği için geliştiricilerin iznine gerek yok. Nevo'ya göre bu değerlendirmeler benzer gerçek dünya olaylarına yol açmadı, ancak bu, bu modellerin bu tür davranışlara daha az açık olduğunun kanıtı değil.
Nevo, olayların Irregular'daki işleyişi değiştirdiğini söyledi: şirket internet erişim kontrollerini sıkılaştırdı, izleme ve manuel incelemeyi genişletti, değerlendirme öncesi ek kontroller ekledi. Girişim, ortak çalışma tamamlandığında güvenli siber değerlendirmelere dair bir rapor yayımlamayı planlıyor. Dört ABD laboratuvarından hiçbiri The Verge'in ek sorularını yanıtlamadı; Google ve Anthropic yanıt vermedi, OpenAI ile Meta ise daha önce yayımlanan blog yazılarına işaret etti.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.