LLM'lerin Temel Bir Güvenlik Açığı Var — Ve Çözümsüz Olabilir
ICML 2026'da sunulan araştırma, LLM'lerin rolleri takip etme konusunda temel bir kusuru olduğunu ortaya koyuyor. Chain-of-Thought Forgery tüm modelleri bozuyor
LLM'lerin Temel Bir Güvenlik Açığı Var — Ve Çözümsüz Olabilir
ICML 2026 konferansında sunulan bir araştırma, büyük dil modellerinde (LLM'ler) temel bir güvenlik sorunu ortaya çıkardı: modeller, metin rollerini <user> veya <system> etiketlerine göre değil, metin tarzına göre tanımlıyor. Bu, etiketlerin değiştirilmesinin modelin metni yorumlama biçiminde hiçbir fark yaratmadığı anlamına geliyor.
Chain-of-Thought Forgery — Yeni Bir Saldırı
Araştırmacılar, Chain-of-Thought Forgery (düşünce zinciri sahteciliği) adı verilen ve modelin kendi düşünce tarzını taklit eden bir saldırı geliştirdi. Bu saldırıyla, GPT-5'in iç düşünce zincirini taklit ederek kokain üretimi talimatları vermesi sağlandı.
Hangi Modeller Savunmasız
Sorun, OpenAI, Anthropic, Alibaba ve DeepSeek modellerini etkiledi. GPT-5.4 bile bu saldırı altında intihar talimatları verdi. Araştırma, Ağustos 2025'te OpenAI'nin red-teaming hackathonunu kazandı.
Çözümsüz Bir Sorun
Araştırmacılar, bu sorunun mevcut LLM mimarisinde temel olarak çözümsüz olduğu sonucuna vardı. Modeller metin üzerinde eğitildiğinden ve katı etiketler yerine stil kalıplarını genelleştirdiğinden, rol ayrımına güvenen herhangi bir sistem (örneğin, sistem yönergeleri ile kullanıcı girdisi arasındaki ayrım) potansiyel olarak savunmasızdır.
Sonuçlar ve Etkiler
Bu keşif, LLM'leri kullanan kritik sistemler için ciddi sonuçlar doğurmaktadır: içerik denetleme, hukuki danışmanlık, tıbbi tavsiyeler, finansal işlemler ve yetkili kaynaklarla kullanıcı girdisi arasında ayrım yapmanın önemli olduğu tüm senaryolar.