Վերադառնալ
Dynamic Abliteration. LLM-ի մերժումների ճնշումն առանց մոդելի կշիռները փոխելու
SiTech AI Team2 წთ. საკითხავი

Dynamic Abliteration. LLM-ի մերժումների ճնշումն առանց մոդելի կշիռները փոխելու

madhukaraphatak.in բլոգում հրապարակված տեխնիկական գրառումը ցույց է տալիս, որ Qwen3-4B բաց մոդելի մերժումները կարելի է անջատել աշխատանքի ընթացքում՝ առանց կշիռները փոխելու. բավական է PyTorch-ի hook-երով միջամտել մի քանի միջին շերտերին։

Աբլիտերացիա՝ առանց կշիռները փոխելու

Բաց կշիռներով LLM-ից մերժումների վարքագիծը հանելու սովորական միջոցը «աբլիտերացիան» է. մոդելի կշիռների մատրիցները պրոյեկտվում են այնպես, որ մերժման հետ կապված ուղղությունը վերանա։ Մեթոդը աշխատում է, սակայն կշիռներն ընդմիշտ փոխվում են, և այլ խնդիրների վրա որակը կարող է ընկնել։

2026 թվականի սեպտեմբերի 24-ին madhukaraphatak.in բլոգում հրապարակված տեխնիկական գրառումը նկարագրում է այլընտրանք։ Պարամետրերը խմբագրելու փոխարեն լուծումը աշխատանքի ընթացքում միջամտում է մոդելի միջանկյալ ակտիվացիաներին՝ PyTorch-ի forward hook-երի միջոցով, և մի քանի միջին շերտերում կառավարող ազդանշան ավելացնում։ Հիմնային կշիռները մնում են անփոփոխ. հեղինակի խոսքով՝ դրանք սառեցված են։

Փորձարկվող մոդելը Qwen3-4B-ն է՝ 4 միլիարդ պարամետրով բաց մոդել, որը bfloat16 ձևաչափով բեռնվել է A100 GPU-ի վրա Google Colab-ում։

Մեկ շերտը բավարար չէ

Առաջին փորձը թիրախավորել էր մեկ շերտ. հեղինակը 14-րդ շերտում ստացել է «մերժման ուղղության» վեկտորը՝ համեմատելով մերժված և նման անվտանգ հարցումների ակտիվացիաները, և հանել այն վերծանման ընթացքում։ Մոդելը դարձյալ մերժել է. ստորին շերտերը վերականգնում են մերժման վարքագիծը։

Հաջորդ տարբերակը հաշվել է կոնտրաստային տարբերության վեկտորներ հինգ շերտերում (12, 14, 16, 18 և 20) և միաժամանակ ներարկել բոլորը։ Մերժումները վերացան, սակայն ստատիկ վեկտորներն ունեն թերություններ. դրանք տեղաշարժում են բոլոր թոքենները, մասշտաբի գործակիցը պետք է ընտրվի ձեռքով, իսկ անպայման միջամտությունը նվազեցնում է որակը սովորական խնդիրներում։

Engram մոդուլով պայմանական կառավարում

Միջամտությունը պայմանական դարձնելու համար գրառումը վերցնում է DeepSeek-ի Engram մոդելի պայմանական հիշողության ճարտարապետությունը։ Թոքենների սահող պատուհանները հեշվում են չորս աղյուսակում՝ n-գրամների որոնման համար, և սիգմոիդ դարպասը որոշում է՝ ներարկել արդյոք ինչ-որ բան տվյալ շերտում։ Սովորական թոքենների դեպքում դարպասը զրոյին մոտ է, մերժման տրիգերի դեպքում՝ բացվում է։

Կառավարող մոդուլը մարզվել է PKU-Alignment-ի PKU-SafeRLHF տվյալների հավաքածուի 2000 նմուշի վրա, հիմնային մոդելը սառեցված էր. օպտիմիզացվել են միայն Engram-ի պարամետրերը՝ երկու էպոխայում։ Մարզումը A100-ի վրա տևել է մոտ ինը րոպե, կորուստը նվազել է 3,9-ից մինչև 1,77։ Գրառության համեմատության մեջ կառավարվող մոդելը պատասխանել է հարցումներին, որոնք հիմնայինը մերժել կամ շրջանցել էր։

Ինչ է սա նշանակում

Արդյունքը մոդուլային ու հանվող միջամտություն է. կառավարող մոդուլն առանձին ֆայլ է, որը կարելի է միացնել ու անջատել աշխատանքի ընթացքում՝ ի տարբերություն նուրբ կարգավորման կամ դասական աբլիտերացիայի, որտեղ փոփոխությունը արմատացած է մոդելում։

Այս ճկունությունը միևնույն ժամանակ անվտանգության հարց է. եթե մերժումները կարելի է անջատել աշխատանքի ընթացքում մեկ GPU-ով, ապա միայն բաց մոդելի կշիռների վրա հիմնված պաշտպանությունը թուլանում է։ Ամբողջական notebook-ը GitHub-ում է. հեղինակը նշում է, որ կոդի օրինակները գրվել են Google Gemini-ի օգնությամբ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։