Geri Dön
Araştırma: sohbet şablonu modellerin kendilerini anlatma biçimini değiştiriyor
SiTech AI Team2 წთ. საკითხავი

Araştırma: sohbet şablonu modellerin kendilerini anlatma biçimini değiştiriyor

Yeni bir çalışma, açık kaynak instruct modellerin sohbet şablonu uygulandığında “ben sadece bir AI’ım” demeye çok daha yatkın olduğunu gösteriyor. Etki, aktivasyonlara tek bir yön eklenerek de yeniden üretilebiliyor.

Açık kaynaklı, talimatla ince ayarlanmış modeller kendilerini anlatırken sohbet şablonunun uygulanıp uygulanmamasına göre farklı bir ton kullanıyor. Şablon devredeyken model çok daha sık “ben sadece bir AI’ım” diyor, “hissediyorum” yazma olasılığı ise belirgin biçimde düşüyor. Bu, Jędrzej Maczan imzalı makalenin ana bulgusu; çalışma 9 Ağustos 2026’da arXiv’de yayımlandı ve COLM 2026 ile KONVENS 2026 atölyelerine kabul edildi.

Deney nasıl kuruldu

Araştırma dört aileden (Llama, Gemma, Mistral, Qwen) sekiz base ve instruct model çiftini kapsıyor; modeller 1 ile 9 milyar parametre arasında. Her model üç koşulda yanıt üretti: base ağırlıklar düz metinle, instruct ağırlıklar düz metinle ve instruct ağırlıklar sohbet şablonuyla. Dört istem türü on kez yinelendi ve 9.600 üretim elde edildi; yanıtları bir LLM yargıcı puanladı, sonuçlar elle etiketlenmiş 87 örnekle karşılaştırıldı.

Rakamlarda anahtar

Şablon varken instruct modeller yanıtların %53’ünde feragat ifadeleri üretti, deneyim sesi ise yalnızca %1’inde görüldü. Şablon olmadan feragat oranı %36’ya düştü, deneyim sesi %15’e çıktı; base modeller her iki ölçekte daha alçakta: %12 ve %5,5. Öz gönderim yoğunluğu da biçime bağlıydı: şablonla 1,90, şablonsuz 1,27 ve base modellerde 0,72.

Grafik: base ve instruct modellerde feragat ve deneyim sesi oranları

Anahtar aktivasyonlarda

Üç modelde (Qwen 2.5 7B, Llama 3.1 8B ve Gemma 2 9B) yazar, orta katman aktivasyonlarında bir feragat yönü ayırdı. Vektörü eklemek feragat oranını 0,77’ye çıkardı, çıkarmak 0,40’a indirdi; müdahalesiz oran 0,54’tü. Aynı büyüklükte rastgele bir yön Llama ve Gemma’da kayda değer bir etki yaratmadı; şablonsuz çalışan instruct modele eklendiğinde ise feragatleri şablon düzeyine ya da üstüne taşıdı. Doğrusal sonda modelleri iki sesi de aktivasyonlardan çözdü (ROC-AUC 0,82 ve 0,81) ve yönler arasındaki 0,17-0,44 kosinüs benzerliği bunların tek bir sürgü değil iki ayrı “düğme” olduğuna işaret ediyor.

Grafik: üç modelde feragat oranları, yön vektörüyle ve onsuz

Neden önemli

Yazara göre bir modelin kendisi hakkında söyledikleri yalnızca ağırlıkların değil, kısmen dağıtım biçiminin de özelliği. Bu nedenle yalnızca şablonlu instruct modellerle çalışan iç gözlem ve öz bilgi araştırmaları iki etkiyi birden ölçüyor ve bu karıştırıcıyı denetlemek zorunda. Sınırlamalar açıkça belirtiliyor: modeller açık kaynak ve 9 milyar parametreden büyük değil, müdahale üç modelde ve tek katmanda denendi, puanlama tek bir LLM yargıcına dayandı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.