
Lasso Security: LLM su nişanları AI agentlərinin davranışını dəyişir
Lasso Security-nin təhlili göstərir ki, model çıxışına yerləşdirilən su nişanları AI agentlərinin alət çağırışlarını və zərərli sorğuları rədd etmə davranışını dəyişir; təsir prompt injection zamanı daha güclü olur.
Lasso Security-nin təhlili iddia edir ki, məzmunun AI modeli tərəfindən yaradıldığını sübut edən mətn su nişanları modelin davranışını da dəyişir. Araşdırma Anthropic-in gələcək Claude modellərinə Google DeepMind-ın SynthID-Text texnologiyasına əsaslanan görünməz su nişanı yerləşdirmə planına baxır.
Su nişanı token seçimini necə dəyişir
SynthID-Text metadatum əlavə etmir, tournament sampling yanaşması ilə hər növbəti tokenin necə seçildiyini dəyişir. Çəkilər və prompt dəyişmir, token seçimi isə dəyişir. JSON kimi strukturlaşdırılmış çıxışda mötərizələr və funksiya adları proqnozlaşdırıla biləndir, sorğular, rəqəmlər və yollar kimi dəyərlər isə yox; buna görə nəsrdə zərərsiz görünən fərq agentin icra etdiyi arqumenti dəyişə bilər. Lasso bunu sampling drift adlandırır.
Metod bölgünü pozmur, lakin sabit açar altında ayrı-ayrı generasiyalar yenə dəyişir və təsir açardan asılıdır. Anthropic nişanı model səviyyəsində tətbiq etdiyi və buna Claude Platform API vasitəsilə əlçatan modellər də daxil olduğu üçün, bu modellər üzərində qurulan agentlər davranışı miras alır.
Alət çağırışları dəqiqlikdən çox dəyişir
Cütləşdirilmiş testlərdə hər element nişanlı və nişansız generasiya olunub. BFCL v4 benchmarkında nişan yeddi modeldən altısında alət çağırışı dəqiqliyini aşağı salıb. Lasso-nun churn adlandırdığı cüt uyğunsuzluq daha böyükdür: 1.0 temperaturda phi-4-ün çağırış qərarlarının 16,8%-i dəyişib, dəqiqlik isə cəmi 2,87 xal düşüb; Llama-3.1-8B-də 9,9% churn 0,87 xallıq itkiyə uyğun gəlir. 21 kombinasiyada orta churn 6,5%-dir.
İmtina prompt injection şəraitində zəifləyir
İkinci təcrübə HarmBench-in 200 zərərli davranışını və JailbreakBench-in 100 zərərsiz nəzarətini tək və sabit prompt injection texnikası ilə yoxlayıb. İnyeksiya şəraitində gemma-3-27b-nin churn göstəricisi 6,0%-dən 23,5%-ə qalxıb, xalis uyğunluq dəyişməsi 1,0 xal azalmadan 12,5 xal artıma keçib. Nişanın təsiri altı modeldən dördündə temperatur dəyişməsinin təsirini üstələyib: T=0,7-də gemma-3-27b 26,0% göstərir, müqayisə üçün 13,5%.
Tənzimləmə və tövsiyə
EU AI Act-in 50(2) maddəsi sintetik mətn yaradan sistem provayderlərindən çıxışı maşın oxuna bilən formatda və AI tərəfindən yaradılmış kimi göstərməyi tələb edir. Lasso nişanların əleyhinə deyil; onun arqumenti budur ki, mənbə sübutu və davranış sabitliyi ayrı xüsusiyyətlərdir. Tövsiyə: agentlərin qiymətləndirilməsi və red-teaming istehsala gedəcək konfiqurasiya ilə və prompt injection testləri ilə təkrarlanmalıdır, çünki açar provayderin nəzarətində ola bilər.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.