
Lasso Security-ի վերլուծությունը՝ LLM ջրանիշերը փոխում են AI գործակալների վարքը
Lasso Security-ի նոր վերլուծությունը ցույց է տալիս, որ մոդելների ելքի մեջ ներկառուցված ջրանիշերը փոխում են AI գործակալների գործիքների կանչերն ու վնասակար հարցումների մերժումը, հատկապես prompt injection-ի պայմաններում։
Lasso Security-ի վերլուծությունը պնդում է, որ տեքստային ջրանիշերը, որոնք կոչված են ապացուցելու բովանդակության ստեղծումը AI մոդելով, փոխում են նաև մոդելի վարքը։ Այն անդրադառնում է Anthropic-ի ծրագրին՝ Claude-ի ապագա մոդելներում Google DeepMind-ի SynthID-Text-ի վրա հիմնված անտեսանելի ջրանիշ ներդնելու մասին։
Ինչպես է ջրանիշը փոխում թոքենների ընտրությունը
SynthID-Text-ը մետատվյալներ չի ավելացնում, այլ tournament sampling-ի միջոցով փոխում է, թե ինչպես է ընտրվում հաջորդ թոքենը։ Կշիռներն ու prompt-ը մնում են նույնը, թոքենների ընտրությունը՝ ոչ։ JSON-ի նման արդյունքում փակագծերն ու ֆունկցիաների անունները կանխատեսելի են, իսկ արժեքները (հարցումներ, թվեր, ուղիներ)՝ ոչ. այդ պատճառով անվնաս թվացող տարբերությունը կարող է փոխել արգումենտ, որը գործակալը կատարում է։ Lasso-ն դա անվանում է sampling drift։
Մեթոդը չի աղավաղում բաշխվածությունը, սակայն ֆիքսված բանալու դեպքում առանձին գեներացիաները տարբերվում են, և էֆեկտը կախված է բանալուց։ Քանի որ Anthropic-ը ջրանիշը կիրառում է մոդելի մակարդակում՝ ներառյալ Claude Platform API-ով հասանելի մոդելները, այդ մոդելների վրա կառուցված գործակալները ժառանգում են այդ վարքը։
Գործիքների կանչերը փոխվում են ավելի շատ, քան ցույց է տալիս ճշգրտությունը
Զուգորդված թեստերում ամեն տարր գեներացվել է նույն seed-ով՝ ջրանիշով և առանց դրա։ BFCL v4-ի թեստում ջրանիշը իջեցրեց գործիքների կանչերի ճշգրտությունը յոթից վեց մոդելում։ Զուգորդված անհամաձայնությունը, որը Lasso-ն անվանում է churn, շատ ավելի մեծ է. 1.0 ջերմաստիճանում phi-4-ի կանչի որոշումների 16,8%-ը փոխվեց, մինչդեռ ճշգրտությունը նվազեց 2,87 կետով, իսկ Llama-3.1-8B-ում churn-ը 9,9% է՝ 0,87 կետ կորստի դեպքում։ 21 համակցությունում churn-ի միջինը 6,5% է։
Մերժումը թուլանում է prompt injection-ի պայմաններում
Երկրորդ փորձը ներառում էր HarmBench-ի 200 վնասակար վարք և JailbreakBench-ի 100 անվնաս վերահսկիչ՝ մաքուր և prompt injection-ի հետ։ Ներարկման պայմաններում gemma-3-27b-ի churn-ը 6,0%-ից հասավ 23,5%-ի, իսկ զուտ համապատասխանության փոփոխությունը 1,0 կետ նվազումից դարձավ 12,5 կետ աճ։ Ջրանիշի ազդեցությունը գերազանցեց ջերմաստիճանի ազդեցությանը վեցից չորս մոդելում. T=0,7-ում gemma-3-27b-ը ցույց է տալիս 26,0%՝ 13,5%-ի դիմաց։
Կարգավորում և առաջարկություն
EU AI Act-ի 50(2) հոդվածը պահանջում է, որ սինթետիկ տեքստ արտադրող համակարգերի մատակարարները արդյունքը նշեն մեքենայաընթեռնելի ձևաչափով։ Lasso-ն դեմ չէ ջրանիշերին. փաստարկն այն է, որ ծագման ապացույցը և վարքային կայունությունը տարբեր հատկություններ են, այդ պատճառով գործակալների գնահատումն ու red-teaming-ը արտադրության կոնֆիգուրացիայով ու prompt injection-ի թեստերով կրկնել է պետք։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։