
Lasso Security-ის კვლევა: წყალნიშნები AI აგენტების ქცევას ცვლის
Lasso Security-ის ახალი ანალიზით, მოდელის გამომავალში ჩაშენებული წყალნიშანი ცვლის იმას, თუ როგორ იძახებს AI აგენტი ინსტრუმენტებს და რამდენად სტაბილურად უარყოფს საშიშ მოთხოვნებს. ყველაზე მკვეთრი ეფექტი prompt injection-ის დროს ჩანს.
უსაფრთხოების კომპანია Lasso Security-ის ანალიზი ამტკიცებს, რომ ტექსტის წყალნიშანი, კონტენტის AI-ის მიერ შექმნის დასამტკიცებლად შემოღებული, მოდელის ქცევასაც ცვლის. კვლევა Anthropic-ის გეგმას ეხება: Claude-ის მომავალ მოდელებში ჩაშენებული უხილავი წყალნიშანი Google DeepMind-ის SynthID-Text-ს ეფუძნება.
როგორ ცვლის წყალნიშანი ტოკენების არჩევანს
გვერდით ეფექტს თავად მექანიზმი ქმნის: SynthID-Text მეტამონაცემებს არ ამატებს, არამედ tournament sampling-ით ცვლის, როგორ ირჩევა ყოველი მომდევნო ტოკენი. წონები და prompt უცვლელია, ტოკენების არჩევანი კი აღარ. JSON-ის მსგავს გამომავალში ფრჩხილები და ფუნქციების სახელები პროგნოზირებადია, მნიშვნელობები კი არა, ამიტომ პროზაში უწყინარი ცვლილება შეიძლება არგუმენტად იქცეს, რომელსაც აგენტი ასრულებს. Lasso ამას sampling drift-ს უწოდებს.
მეთოდი განაწილებას არ ამახინჯებს, თუმცა ფიქსირებული გასაღების დროს ცალკეული გენერაციები მაინც იცვლება. რადგან Anthropic წყალნიშანს მოდელის დონეზე აყენებს, Claude Platform API-ით ხელმისაწვდომ მოდელებზეც, ამ მოდელებზე აგებული აგენტები ქცევას მემკვიდრეობით იღებენ.
გამოძახება სიზუსტის ვარდნაზე მეტად იცვლება
დაწყვილებულ ტესტებში ყოველი დავალება იმავე seed-ით, წყალნიშნით და მის გარეშე დაგენერირდა. BFCL v4-ის ტესტზე წყალნიშანმა შვიდი მოდელიდან ექვსზე გამოძახების სიზუსტე შეამცირა. დაწყვილებული განსხვავება (churn) გაცილებით დიდია: 1,0 ტემპერატურაზე phi-4-ის გამოძახებების 16,8% შეიცვალა, სიზუსტე კი 2,87 პუნქტით დაეცა, Llama-3.1-8B-ზე 9,9% churn 0,87 პუნქტიანი დანაკარგის ფონზე დაფიქსირდა. 21 კომბინაციაში churn-ის საშუალო 6,5%-ია.
უარის თქმა prompt injection-ის ქვეშ სუსტდება
HarmBench-ის 200 საშიში ქცევა და JailbreakBench-ის 100 უწყინარი შემთხვევა ცალკე და ფიქსირებული prompt injection-ის ტექნიკით შემოწმდა. ინექციის დროს gemma-3-27b-ის churn 6,0%-დან 23,5%-მდე გაიზარდა, დათმობის წმინდა მაჩვენებელი კი 1,0 პუნქტით კლებიდან 12,5 პუნქტით ზრდაზე გადავიდა. წყალნიშნის ეფექტი ტემპერატურის ცვლილების ეფექტზე მეტია ექვსიდან ოთხ მოდელზე: 0,7 ტემპერატურაზე gemma-3-27b 26,0%-ს აჩვენებს 13,5%-ის წინააღმდეგ.
რეგულაცია და რეკომენდაცია
ევროკავშირის AI Act-ის 50(2) მუხლი სინთეტიკური ტექსტის გენერატორი სისტემების პროვაიდერებს ავალდებულებს, გამომავალი მანქანურად წაკითხვადად მონიშნონ და AI-ის მიერ შექმნილად დეტექტირებადი გახადონ. Lasso წყალნიშნის წინააღმდეგ არ გამოდის: მისი არგუმენტია, რომ წარმომავლობის დადასტურება და ქცევითი სტაბილურობა სხვადასხვა თვისებაა. კომპანია გვირჩევს, აგენტების შეფასება და red-teaming ექსპლუატაციის კონფიგურაციით გაიმეორონ, რადგან გასაღები შეიძლება აგენტის დეველოპერს არ ექვემდებარებოდეს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.