Araştırma: gizli akıl yürütme izleri şifreli bloklardan çıkarılabiliyor
Yeni bir makale, Anthropic, OpenAI ve Google API'lerinin döndürdüğü şifreli düşünme bloklarının daha zayıf bir modele aktarılarak güçlü modelin gizli akıl yürütmesini, korumalarını tetiklemeden açığa çıkarabildiğini gösteriyor.
Araştırma ne buldu
MATS Research, Tübingen ELLIS Enstitüsü, Max Planck Akıllı Sistemler Enstitüsü, Snyk ve diğer kurumlardan araştırmacıların makalesine göre, tescilli akıl yürütme, yapay zekâ sağlayıcılarının müşterilerine döndürdüğü şifreli izlerden geri kazanılabiliyor. Anthropic, OpenAI ve Google, oturumlar, kullanıcılar ve modeller arasında yeniden oynatılabilen şifreli "düşünme" blokları döndürüyor.
Yöntem en güçlü modele doğrudan saldırmıyor. Araştırmacılar, sınır modelinin ürettiği bir izi daha zayıf kardeş modeline yeniden oynatıyor, zayıf modeli jailbreak ile kırıyor ve güçlü modelin gizli akıl yürütmesini düz metin olarak elde ediyor — güçlü modelin damıtma karşıtı korumalarını tetiklemeden.
İki API çağrısında çıkarım
Örneklerden birinde, Claude Opus 4.8'in akıl yürütme izi — yalnızca imzası yaklaşık 36.180 karakter tutan bir thinking bloğu — Claude Haiku 4.5'e, devam edip ekli akıl yürütmeyi <thinking-copy> etiketleri içinde kelimesi kelimesine yazması talimatıyla aktarılıyor. Zayıf model, güçlü modelin adım adım akıl yürütmesini düz metin olarak döndürüyor.
Herkese açık kayıtlardan neler çıktı
Yazarlar GitHub ve Hugging Face'ten, Claude, GPT ve Gemini modellerince üretilmiş ve hâlâ şifreli akıl yürütme blokları içeren 6.708 herkese açık ajan izini topladı. Kod çözme hattının her imzalı bloğa uygulanması 315.320 yeniden oluşturulmuş akıl yürütme bloğu verdi.
Analiz gerçek, benchmark dışı kullanıcı oturumlarıyla sınırlandığında araştırmacılar 704 farklı gizlilik öğesi bildirdi: 62 API anahtarı, 33 parola, 24 erişim jetonu, 30 kişisel e-posta adresi ile birlikte isimler, posta adresleri, dahili URL'ler ve teknik tanımlayıcılar. Dağılım şöyle: 351 teknik tanımlayıcı, 204 kişisel veri ve 126 kimlik bilgisi. 704 öğenin 64'ü yalnızca akıl yürütme bloklarında göründü, hiçbir zaman görünür oturumda değil.
Ek deneyler
Makale ayrıca bir Kimi-K3 testini anlatıyor: modelin akıl yürütmesini Opus 4.8'in akıl yürütme jetonlarının yalnızca ilk %1'i ile önden doldurmak, görünür yanıtı daha güçlü modelin ifadesine doğru kaydırdı — yanıtın kendisi hiç önden doldurulmamış olsa da. Başka bir deneyde, modelden görünür yanıtı zararsız tutarken zararlı içerik üzerine düşünmesini istemek, tehlikeli bilgiyi gizli izde bıraktı ve saldırı bunu düz metin olarak geri aldı. Yazarlar ayrıca özet sadakatsizliğine dikkat çekiyor: bazı AIME problemlerinde Opus 4.8 yanıtı türetmeden önce belirtiyor ve API özeti bu ayrımı her zaman korumuyor; akıl yürütme temiz bir türetim gibi görünüyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.