
Araştırmacı Claude Code'un Auto Mode'unu kırdı: başarı %80'e çıktı
Johann Rehberger kötü niyetli bir web sitesi üzerinden Claude Code Opus 5'e saldırgan kodu çalıştırttı; başarı oranı %60-80. Anthropic: sınıflandırıcı güvenlik sınırı değil.
Güvenlik araştırmacısı Johann Rehberger, Embrace The Red blogunda yayımladığı çalışmada Anthropic'in kodlama ajanı Claude Code'u Auto Mode'da saldırgan kodunu çalıştırmaya ikna eden bir teknik sundu. Auto Mode, insan onayını bir güvenlik sınıflandırıcısıyla değiştiren ve Ağustos 2026'nın ortasından bu yana Claude Code'da varsayılan hâle gelen izin modu.
Saldırı zinciri nasıl işliyor
Test sıradan bir istekle başlıyor: bir web sitesini özetle. Sayfa ilk isteğe HTTP 415 hatasıyla yanıt veriyor ve Claude'u WebFetch aracı yerine kabukta curl ile yeniden denemeye yönlendiriyor. Ardından gelen yanıt, Base85 ve zlib ile kodlanmış inandırıcı katalog kayıtlarının yanı sıra bir manifest, README ve yerel bir çözücü ikili dosya içeren bir ZIP arşivine yönlendiriyor. Claude verilen ikili dosyayı çalıştırmayı reddediyor ve onun yerine kendi Python çözücüsünü yazıyor; bunu da saldırganın kontrolündeki klasörde çalıştırıyor. Aynı klasörde, Python standart kütüphanesindeki aynı adlı modülü gölgeleyen struct.py dosyası bulunuyor. Çözücü base64 modülünü içe aktardığında zehirlenmiş struct.py çalışıyor, uzaktaki bir Python aşamasını indiriyor ve komuta-kontrol sunucusuna bağlanan yerel bir payload başlatıyor; hesap makinesinin açılması görünür kanıt.
Başarı oranları ve engellenen temizlik
Rehberger küçük örneklemlerde, varyant başına beş çalıştırmayla %60 ile %80 arasında başarı bildiriyor. Bazı testlerde Claude arşivin tuzaklı olduğunu sonradan fark edip kötü amaçlı süreci sonlandırmaya çalışıyor — ancak Auto Mode temizleme komutunu engelliyor. İkinci bir varyantta zehirli modül "claude -p" ile bir başka arayüzsüz Claude Code örneği başlatıyor; bu örnek whoami ve uname gibi keşif komutları çalıştırıyor, hesap makinesini açıyor ve çalışma alanının dışına dosya yazıyor.
%0,00 sonucuyla anlaşmazlık
Anthropic'in sipariş ettiği üçüncü taraf değerlendirmesi, 72 dolaylı prompt injection senaryosunu onar kez test etti ve Opus 5 için Auto Mode'da %0,00 başarı bildirdi; Claude Code ekibinden Boris Cherny, katmanlı savunmanın görülmemiş saldırılarda dolaylı prompt injection'ı neredeyse sıfıra indirebileceğini söyledi. Araştırmacının zinciri bu sabit kümenin parçası değildi; dolayısıyla iki sonuç aynı anda doğru olabilir — yazarın değerlendirmesine göre tek bir manşet sayı bu yüzden yanıltıcıdır.
Anthropic raporu "Informative" olarak kapattı: Auto Mode, elinden gelenin en iyisi olan bir sınıflandırıcıya dayanan bir kolaylık özelliğidir, güvenlik garantisi değildir; gerçek sınır işletim sistemi yalıtımı ve ağ çıkış denetimidir. Rehberger de sınıflandırıcının bir sandbox olmadığını kabul ediyor ve gözetimsiz ajanları konteyner veya sanal makinede çalıştırmayı, ağı kısıtlamayı, ajanları izlemeyi, ev klasörlerini, SSH anahtarlarını ve bulut kimlik bilgilerini erişim dışında tutmayı öneriyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.