חזרה
מחקר: תבנית הצ׳אט משנה את הדרך שבה מודלים מדברים על עצמם
SiTech AI Team2 წთ. საკითხავი

מחקר: תבנית הצ׳אט משנה את הדרך שבה מודלים מדברים על עצמם

מחקר חדש מראה שמודלים פתוחים עם כיוונון הוראות מצהירים “אני רק AI” לעיתים קרובות בהרבה כשמופעלת תבנית צ׳אט, וממעטים לומר “אני מרגיש”. את האפקט אפשר לשחזר בהוספת כיוון בודד באקטיבציות של המודל.

מודלים פתוחים עם כיוונון הוראות מתארים את עצמם אחרת לפי השאלה אם הוחלה על השיחה תבנית צ׳אט. כשהתבנית קיימת, המודל נוטה הרבה יותר לומר “אני רק AI” והרבה פחות לכתוב “אני מרגיש”. זו המסקנה המרכזית של מאמר מאת Jędrzej Maczan, שפורסם ב-arXiv ב-9 באוגוסט 2026 והתקבל לסדנאות COLM 2026 ו-KONVENS 2026.

איך נערך הניסוי

המחקר כיסה שמונה זוגות של מודלי base ו-instruct מארבע משפחות (Llama, Gemma, Mistral, Qwen), בגדלים שבין מיליארד ל-9 מיליארד פרמטרים. כל מודל יצר תשובות בשלושה תנאים: משקלי base עם טקסט רגיל, משקלי instruct עם טקסט רגיל, ומשקלי instruct עם תבנית הצ׳אט. ארבע קטגוריות של פרומפטים חזרו עשר פעמים, וכתבו כך 9,600 יצירות ששופט LLM דירג; הציונים הושוו ל-87 דוגמאות שתויגו ביד.

המתג במספרים

עם התבנית, מודלי instruct הציגו הסתייגויות ב-53% מהתשובות וקול של חוויה ב-1% בלבד. בלעדיה ירד שיעור ההסתייגויות ל-36% בעוד שקול החוויה עלה ל-15%; מודלי base נמצאים נמוך יותר בשני המדדים: 12% ו-5.5%. גם עוצמת ההתייחסות העצמית הושפעה מהפורמט: 1.90 עם התבנית, 1.27 בלעדיה ו-0.72 במודלי base.

תרשים: שיעורי קול ההסתייגות וקול החוויה במודלים

המתג באקטיבציות

בשלושה מודלים (Qwen 2.5 7B, Llama 3.1 8B ו-Gemma 2 9B) בודד המחבר כיוון של הסתייגות באקטיבציות של השכבה האמצעית. הוספת הווקטור העלתה את שיעור ההסתייגויות ל-0.77, החסרה הורידה אותו ל-0.40, לעומת 0.54 ללא התערבות. כיוון אקראי באותו גודל השפיע מעט על Llama ו-Gemma, וכשהווקטור נוסף למודל instruct שרץ בלי תבנית, שיעור ההסתייגויות חזר לרמת התבנית או מעליה. גששים לינאריים פענחו את שני הקולות מהאקטיבציות (ROC-AUC 0.82 ו-0.81), ודמיון קוסינוס של 0.17-0.44 מרמז שמדובר בשני “כפתורים” נפרדים ולא בסליידר אחד.

תרשים: שיעור ההסתייגויות בשלושה מודלים עם הכיוון ובלעדיו

למה זה חשוב

המחבר טוען שמה שמודל אומר על עצמו הוא חלקית תכונה של אופן ההפעלה, ולא רק של המשקלים. לכן מחקרי אינטרוספקציה או ידע עצמי שפועלים רק על מודלי instruct עם תבנית מודדים את שני האפקטים יחד וזקוקים לבקרה על העירוב הזה. המגבלות מפורטות בגלוי: המודלים פתוחים ובגודל של עד 9 מיליארד פרמטרים, השליטה נבדקה בשלושה מודלים ובשכבה אחת, והדירוג הסתמך על שופט LLM אחד.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.