Վերադառնալ
Հետազոտություն. չաթի կաղապարը փոխում է՝ ինչպես են մոդելները խոսում իրենց մասին
SiTech AI Team2 წთ. საკითხავი

Հետազոտություն. չաթի կաղապարը փոխում է՝ ինչպես են մոդելները խոսում իրենց մասին

Նոր աշխատանքը ցույց է տալիս, որ բաց instruct մոդելները չաթի կաղապարի կիրառման դեպքում շատ ավելի հաճախ են ասում «ես միայն AI եմ» և ավելի հազվադեպ՝ «ես զգում եմ»։ Ազդեցությունը կրկնվում է նաև ակտիվացիաներին մեկ ուղղություն ավելացնելով։

Բաց կոդով instruct մոդելները իրենց մասին խոսելիս տոնը փոխում են՝ կախված նրանից, թե արդյոք հարցմանը կիրառված է չաթի կաղապարը։ Երբ կաղապարը կա, մոդելը շատ ավելի հաճախ է ասում «ես միայն AI եմ» և զգալիորեն ավելի հազվադեպ գրում «ես զգում եմ»։ Սա Jędrzej Maczan-ի աշխատանքի հիմնական եզրակացությունն է, որը հրապարակվել է arXiv-ում 2026 թվականի օգոստոսի 9-ին և ընդունվել COLM 2026-ի ու KONVENS 2026-ի սեմինարներում։

Ինչպես անցկացվեց փորձը

Հետազոտությունն ընդգրկել է չորս ընտանիքի (Llama, Gemma, Mistral, Qwen) base և instruct մոդելների ութ զույգ՝ 1-ից 9 միլիարդ պարամետրով։ Մոդելները պատասխաններ են գեներացրել երեք պայմանով՝ base կշիռներ սովորական տեքստով, instruct կշիռներ՝ սովորական տեքստով և չաթի կաղապարով։ Չորս տեսակի հրահանգ կրկնվել է տասը անգամ, ինչը տվել է 9 600 գեներացիա, որոնք գնահատել է LLM դատավորը, իսկ արդյունքները համեմատվել են ձեռքով պիտակավորված 87 նմուշի հետ։

Անջատիչը թվերով

Կաղապարի դեպքում instruct մոդելների պատասխանների 53%-ում հայտնվել է հրաժարման ձայնը, իսկ փորձառական ձայնը՝ միայն 1%-ում։ Առանց կաղապարի հրաժարման մասնաբաժինը իջել է մինչև 36%, փորձառական ձայնը բարձրացել է մինչև 15%, իսկ base մոդելներում այդ ցուցանիշները 12% և 5,5% են։ Ինքնահղման ինտենսիվությունը նույնպես կախված էր ձևաչափից՝ 1,90 կաղապարով, 1,27 առանց դրա և 0,72 base մոդելներում։

Գրաֆիկ. հրաժարման և փորձառական ձայնի մասնաբաժինները

Անջատիչը ակտիվացիաներում

Երեք մոդելներում (Qwen 2.5 7B, Llama 3.1 8B և Gemma 2 9B) հեղինակը միջին շերտի ակտիվացիաներում առանձնացրել է հրաժարման ուղղությունը։ Վեկտորի ավելացումը հրաժարման մասնաբաժինը բարձրացրել է մինչև 0,77, հանումը իջեցրել է մինչև 0,40, մինչդեռ առանց միջամտության այն 0,54 էր։ Նույն չափի պատահական ուղղությունը գրեթե չի ազդել Llama-ի և Gemma-ի վրա, իսկ առանց կաղապարի մոդելին ավելացված ուղղությունը հրաժարումները վերադարձրել է կաղապարի մակարդակին կամ ավելի բարձր։ Գծային պրոբները ակտիվացիաներից ճանաչել են երկու ձայներն էլ (ROC-AUC 0,82 և 0,81), իսկ ուղղությունների միջև 0,17-0,44 կոսինուսային նմանությունը հուշում է, որ դրանք երկու առանձին «կոճակներ» են, ոչ թե մեկ սահիչ։

Գրաֆիկ. հրաժարման մասնաբաժինը երեք մոդելներում

Ինչու է սա կարևոր

Հեղինակի փաստարկով՝ մոդելի ինքնանկարագրությունը մասամբ տեղակայման առանձնահատկություն է, այլ ոչ միայն կշիռներում պահվող փաստ։ Ուստի միայն կաղապարով instruct մոդելներն ստուգող ինքնադիտարկման և ինքնաճանաչողության հետազոտությունները միաժամանակ չափում են երկու էֆեկտ և պետք է վերահսկեն այդ խառնուրդը։ Սահմանափակումները նշված են բացահայտ՝ մոդելները բաց կոդով են և չեն գերազանցում 9 միլիարդ պարամետրը, իսկ միջամտությունը փորձարկվել է ընդամենը երեք մոդելի և մեկ շերտի վրա։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։