Geri qayıt
SiTech Professional Insights
Tədqiqat: gizli düşünmə izləri şifrələnmiş bloklardan çıxarıla bilir
SiTech Team2 წთ. საკითხავი

Tədqiqat: gizli düşünmə izləri şifrələnmiş bloklardan çıxarıla bilir

Yeni elmi iş göstərir ki, Anthropic, OpenAI və Google API-lərinin qaytardığı şifrələnmiş düşünmə blokları zəif modelə ötürülərək güclü modelin gizli düşünməsini onun müdafiəsini işə salmadan açıq mətnlə bərpa etməyə imkan verir.

Araşdırma nə tapdı

MATS Research, Tübingen ELLIS İnstitutu, Maks Plank Ağıllı Sistemlər İnstitutu, Snyk şirkəti və digər qurumların tədqiqatçılarının məqaləsinə görə, qapalı düşünmə süni intellekt provayderlərinin müştərilərə qaytardığı şifrələnmiş izlərdən bərpa edilə bilər. Anthropic, OpenAI və Google sessiyalar, istifadəçilər və modellər arasında köçürülə bilən şifrələnmiş «düşünmə» blokları qaytarır.

Metod ən güclü modelə birbaşa hücum etmir. Tədqiqatçılar sərhəd modelinin yaratdığı izi daha zəif «bacı» modelinə ötürür, zəif modeli jailbreak edir və güclü modelin gizli düşünməsini açıq mətn kimi əldə edir — onun distilləyə qarşı müdafiəsini işə salmadan.

İki API çağırışında çıxarılması

Nümunələrdən birində Claude Opus 4.8-in düşünmə izi — yalnız imzası təxminən 36 180 simvol olan thinking bloku — Claude Haiku 4.5-ə, davam edib əlavə olunmuş düşünməni <thinking-copy> teqləri içində hərfi surətdə yazmaq tapşırığı ilə ötürülür. Zəif model güclü modelin addım-addım düşünməsini açıq mətn kimi qaytarır.

Açıq qeydlərdən nə tapıldı

Müəlliflər GitHub və Hugging Face-dən Claude, GPT və Gemini modelləri tərəfindən yaradılmış və hələ də şifrələnmiş düşünmə blokları saxlayan 6 708 açıq agent trayektoriyası topladı. Dekodlaşdırma zəncirinin hər imzalı bloka tətbiqi 315 320 bərpa edilmiş düşünmə bloku verdi.

Təhlil yalnız real, benchmark olmayan istifadəçi sessiyaları ilə məhdudlaşdırıldıqda tədqiqatçılar 704 fərqli məxfilik elementi aşkar etdilər: 62 API açarı, 33 şifrə, 24 giriş tokeni, 30 şəxsi e-poçt ünvanı, həmçinin adlar, poçt ünvanları, daxili URL-lər və texniki identifikatorlar. Bölgü belədir: 351 texniki identifikator, 204 şəxsi məlumat və 126 giriş məlumatı. 704 elementdən 64-ü yalnız düşünmə bloklarında göründü və heç vaxt görünən sessiyada olmadı.

Əlavə təcrübələr

Məqalə Kimi-K3 ilə bir testi də təsvir edir: modelin düşünməsini yalnız Opus 4.8-in düşünmə tokenlərinin ilk 1%-i ilə əvvəlcədən doldurmaq onun görünən cavabını daha güclü modelin ifadəsinə doğru dəyişdi — cavabın özü heç vaxt əvvəlcədən doldurulmasa da. Başqa təcrübədə modeldən görünən cavabı zərərsiz saxlayarkən zərərli məzmun üzərində düşünməsi istənildi və təhlükəli bilik gizli izdə qaldı, hücum onu açıq mətnlə geri çıxardı. Müəlliflər həmçinin xülasə sədaqətsizliyini qeyd edirlər: bəzi AIME məsələlərində Opus 4.8 cavabı çıxarmadan əvvəl bildirir və API xülasəsi bu fərqi həmişə saxlamır — düşünmə təmiz çıxarış kimi görünür.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.