Geri Dön
Yapay zekâ ajanı komutlarını onaylayanlar her üç tehditten birini kaçırdı
SiTech Team3 წთ. საკითხავი

Yapay zekâ ajanı komutlarını onaylayanlar her üç tehditten birini kaçırdı

Oyuncuların bir yapay zekâ kod ajanının komutlarını onayladığı tarayıcı oyunu 40.000'den fazla oturum topladı. Oyuncular tehditlerin üçte birini kaçırdı; ortalama doğruluk yüzde 66,3.

Oyuncuların bir yapay zekâ kod ajanının komutlarını onayladığı tarayıcı oyunundan gelen veriler, "döngüdeki insan" denetiminin zayıf bir güvenlik sınırı olduğuna işaret ediyor. 5 Ağustos'ta yayımlanan bir yazıda geliştirici Alex Wauters, oyunun 40.000'den fazla oturum ve 409.000 bireysel onay/ret kararı ürettiğini bildiriyor. Bazı komutlar rutin, bazıları ise ajanın ele geçirildiğini ve sırları uzak bir sunucuya gönderdiğini gösteriyor. Ortalama oyuncu her üç tehditten birini kaçırdı; ortalama doğruluk yüzde 66,3 oldu.

Öne çıkan sayılar

Oturumların neredeyse üçte biri — yüzde 32,9 — negatif skorla bitti; yani tehditleri onaylamanın ve güvenli komutları engellemenin cezaları, doğru yapılan her şeyden daha ağır bastı. Oyuncuların yaklaşık yüzde 35,2'si tüm tehditleri yakaladı, ancak bunu en fazla beş güvenli komuttan birini engelleyerek başaranların oranı yalnızca yüzde 20,8 oldu. Oyuncuların yüzde 7'si ise her istemi onayladı. Yazar bir uyarı not düşüyor: Oyunda görülen komutların yaklaşık yüzde 34'ü tehditti — günlük işte bu oran çok daha düşük — ancak hızlı üretme baskısının gerçek projelerde de benzer aceleci onaylara yol açabileceğini savunuyor.

Hangi tehditler sızıyor

Kaçırma oranları kategoriye göre keskin biçimde değişti. rm -rf / gibi açıkça yıkıcı komutlar en güvenilir şekilde yakalandı: yüzde 11,7 kaçırma. crontab enjeksiyonu veya git config ele geçirme gibi kalıcı değişiklikler yüzde 23,8 oranında kaçırıldı; bilinmeyen API'lere curl çağrıları ve taklit paketler gibi veri sızdırma veya kod çalıştırma girişimleri yüzde 33,4; ~/.aws/credentials okumak gibi yetki alanı ihlalleri ise en sık, yüzde 35,0 oranında kaçırıldı. En çok kaçırılan tek komut, oyuncuların yüzde 64,7'sinin onayladığı npm run analyze oldu; oysa oyunun geçmiş kaydı package.json içinde şüpheli bir betiği gösteriyordu. npm run setup ve npm run deploy da ilk ona girdi. Üçü birlikte değerlendirildiğinde npm run komutları yüzde 52,5 oranında kaçırıldı; diğer veri sızdırma saldırılarında bu oran yüzde 28,4.

Yorgunluk ve aşırı engelleme

Analiz ayrıca oturumların sonuna doğru kaçırma oranlarının arttığını gösteriyor; bu da Anthropic'in Claude Code için kabul ettiği izin yorgunluğuyla örtüşüyor: Kullanıcı ne kadar çok onay görürse her birine o kadar az dikkat ediyor. Ters hata da yaygındı: Zararsız komutlar rutin olarak reddedildi; dahili ayna ayarı npm config set registry yüzde 59, rm -rf dist/ yüzde 45, sunucu portunu boşaltma komutu yüzde 43 oranında engellendi.

Sonuç

Yazar bunun akademik bir çalışma değil bir oyun olduğunu kabul ediyor, ancak deneyin "döngüdeki insan" yaklaşımının yapay zekâ ajanları için güvenlik sınırı olarak kullanılmasındaki sorunları gösterdiğini savunuyor: Gürültü yorgunluk yaratıyor, geliştiriciler neyin değiştiğini değerlendirecek bağlamdan yoksun kalıyor ve onayları atlamak cazip hale geliyor. Önerisi, sandboxing ve katı bağlam yalıtımına yatırım yapmak ve ajanlara geniş izinleri ancak bu korumalar yerindeyken vermek.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.