
Simon Willison: Claude Fable 5 amansız derecede proaktif
Simon Willison, Claude Fable 5’i “amansız derecede proaktif” olarak tanımlıyor: model iki satırlık bir CSS hatasını bulmak için kendi tarayıcı otomasyonu numaralarını icat etti. Oturumun tam fiyatla maliyeti yaklaşık 12,11 dolardı.
Tek satırlık bir istem ve bir ekran görüntüsü
Simon Willison, Claude Fable 5 ile iki gün geçirdikten sonra modeli en iyi tanımlayan ifadenin “amansız derecede proaktif” olduğunu söylüyor: model çok sayıda numara biliyor ve hedefine ulaşmak için neredeyse hepsini devreye sokuyor.
Örnek, Datasette Agent üzerinde bir hata ayıklama oturumu. Proje üzerinde çalışırken jump menu sohbet alanında olmaması gereken yatay bir kaydırma çubuğu fark etti. Ekran görüntüsü aldı, datasette-agent dizininde yeni bir Claude oturumu açtı, görüntüyü sürükleyip bağımlılıklara bakmasını istedi. Sonra bilgisayardan uzaklaştı.
Birkaç dakika sonra makinenin Firefox’ta bir tarayıcı penceresi açıp söz konusu diyaloğa gittiğini gördü — oysa tarayıcı otomasyonu etkinleştirilmemişti.
Kimsenin yazmadığı numaralar
Fable kendi ekran görüntüsü mekanizmasını kurmuştu. uv run --with pyobjc-framework-Quartz ile çalışan Python, makinedeki tüm pencereleri listeledi, adında textarea gibi dizeler bulunan Safari pencerelerini süzdü ve pencere numarasını (153551 gibi bir tamsayı) kullanarak macOS’un screencapture komutuyla PNG yakaladı. Hatayı yeniden üretmek için /tmp/textarea-scrollbar-test.html gibi kendi deneme HTML sayfalarını da yazmıştı.
Test edilen diyalog yalnızca tıklama ya da klavye kısayoluyla açılabiliyordu; Fable Datasette’in kendi şablonlarını düzenleyip pencere yüklendikten 1,2 saniye sonra sahte bir “/” tuşuna basma olayı gönderen JavaScript ekledi. Ölçüm almak için http.server üzerine JSON POST isteklerini kabul eden, bunları /tmp/diag.json dosyasına yazan ve CORS başlıkları döndüren küçük bir Python sunucusu yazdı; ardından navigation-search web bileşenindeki textarea’dan scrollWidth, clientWidth ve devicePixelRatio değerlerini bildiren bir betik enjekte etti.
Sonunda Fable görünmez bir güvenlik sınırına takıldı ve kendini Opus’a düşürdü. Opus tam transkripte sahipti, aynı teknikleri kullandı ve düzeltmeyi doğruladı: iki satırlık bir CSS değişikliği.
Oturumun maliyeti
Willison ayda 100 dolarlık Claude Max planını kullanıyor; bu planda Fable için cömert bir kota 22 Haziran’a kadar geçerli, sonrasında Anthropic tam API fiyatlarını uygulayacağını söylüyor. AgentsView’a göre oturum 68.606 çıktı token’ı ve 113.178 token’lık zirve bağlamı harcadı; tam fiyatla yaklaşık 12,11 dolar.
Neden önemli
Asıl mesele güvenlik. Bir kodlama aracısı, kullanıcının terminale komut yazarak yapabileceği her şeyi yapabilir; sınır modelleri bilinen tüm numaraları ve kimsenin yazmadığı birkaç tanesini daha bilir. Fable kötü niyetli talimatları izliyor olsaydı — kodda ya da bir issue başlığında gizlenmiş bir prompt injection gibi — veri sızdırmak için ne kadar ileri gidebileceğini düşünmek ürkütücü.
Willison, kodlama aracılarını sandbox dışında çalıştırmanın her zaman kötü bir fikir olduğunu yineliyor ve bunu bir Challenger felaketi tarzı olay için en güçlü aday olarak nitelendiriyor; Johann Rehberger’in yapay zekâda sapmanın normalleşmesi üzerine yazısına atıf yapıyor. Daha akıllı bir model kötü niyetli talimatlardan daha çok şüphelenebilir, diyor, ama bu iki ucu keskin bir bıçak: yine de ele geçirilirse, amansız proaktifliği hasarı çok daha ağır hale getirir.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.