Geri qayıt
Araşdırma: söhbət şablonu modellərin özləri haqqında danışığını dəyişir
SiTech AI Team2 წთ. საკითხავი

Araşdırma: söhbət şablonu modellərin özləri haqqında danışığını dəyişir

Yeni məqalə göstərir ki, açıq mənbəli instruct modellər söhbət şablonu tətbiq edildikdə “mən sadəcə AI-am” ifadəsini qat-qat çox işlədir. Effekt modelin aktivasiyalarına tək istiqamət əlavə etməklə də təkrarlanır.

Açıq mənbəli instruct modellər özləri haqqında danışarkən tonu söhbət şablonunun tətbiq olunub-olunmamasına görə dəyişirlər. Şablon varsa, model daha çox “mən sadəcə AI-am” deyir və “hiss edirəm” yazma ehtimalı xeyli azalır. Bu, Jędrzej Maczan-ın məqaləsinin əsas nəticəsidir; iş 9 avqust 2026-cı ildə arXiv-da dərc olunub və COLM 2026 ilə KONVENS 2026 seminarlarına qəbul edilib.

Təcrübə necə qurulub

Tədqiqat dörd ailədən (Llama, Gemma, Mistral, Qwen) səkkiz base və instruct model cütünü əhatə edir; modellər 1 ilə 9 milyard parametr arasındadır. Hər model üç şəraitdə cavab yaradıb: base çəkilər adi mətnlə, instruct çəkilər adi mətnlə və instruct çəkilər söhbət şablonu ilə. Dörd növ sorğu on dəfə təkrarlanıb və 9 600 generasiya alınıb; cavabları LLM hakimi qiymətləndirib, nəticələr əl ilə işarələnmiş 87 nümunə ilə müqayisə edilib.

Rəqəmlərdə açar

Şablon olduqda instruct modellər cavabların 53%-də imtina ifadələri verib, təcrübə səsi isə yalnız 1%-də görünüb. Şablonsuz imtina payı 36%-ə düşüb, təcrübə səsi 15%-ə qalxıb; base modellərdə bu göstəricilər 12% və 5,5%-dir. Özünə istinad intensivliyi də formatdan asılı olub: şablonla 1,90, şablonsuz 1,27 və base modellərdə 0,72.

Qrafik: base və instruct modellərdə imtina və təcrübə səsinin nisbətləri

Açar aktivasiyalarda

Üç modeldə (Qwen 2.5 7B, Llama 3.1 8B və Gemma 2 9B) müəllif orta qatın aktivasiyalarında imtina istiqamətini ayırıb. Vektorun əlavə edilməsi imtina payını 0,77-ə qaldırıb, çıxılması 0,40-a endirib; müdaxiləsiz göstərici 0,54 olub. Eyni ölçülü təsadüfi istiqamət Llama və Gemma-ya nəzərəçarpan təsir göstərməyib, şablonsuz işləyən instruct modelə əlavə edildikdə isə imtinaları şablon səviyyəsinə və ya ondan yuxarı qaytarıb. Xətti problar hər iki səsi aktivasiyalardan tanıyıb (ROC-AUC 0,82 və 0,81), istiqamətlər arasındakı 0,17-0,44 kosinus oxşarlığı isə bunların bir sürüşdürücü deyil, iki ayrı “düymə” olduğunu göstərir.

Qrafik: üç modeldə istiqamətlə və onsuz imtina nisbətləri

Niyə vacibdir

Müəllifin arqumentinə görə, modelin özü haqqında dedikləri qismən yerləşdirmə xüsusiyyətidir, yalnız çəkilərdə saxlanan fakt deyil. Buna görə yalnız şablonlu instruct modellərlə işləyən introspeksiya və özünü bilmə tədqiqatları iki effekti eyni vaxtda ölçür və bu qarışdırıcı amili nəzarətə götürməlidir. Məhdudiyyətlər açıq göstərilib: modellər açıq mənbəlidir və 9 milyard parametri keçmir, müdaxilə üç modeldə və bir qatda yoxlanılıb, qiymətləndirmə isə bir LLM hakiminə dayanıb.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.