Geri Dön
Lasso Security: LLM filigranları AI ajanlarının davranışını değiştiriyor
SiTech AI Team2 წთ. საკითხავი

Lasso Security: LLM filigranları AI ajanlarının davranışını değiştiriyor

Lasso Security'nin analizi, model çıktısına gömülen filigranların AI ajanlarının araç çağrılarını ve zararlı istekleri reddetme davranışını değiştirdiğini gösteriyor; etki prompt injection altında belirginleşiyor.

Lasso Security'nin analizi, bir içeriğin AI modeli tarafından üretildiğini kanıtlamak için kullanılan metin filigranlarının modelin davranışını da değiştirdiğini savunuyor. Çalışma, Anthropic'in gelecek Claude modellerine Google DeepMind'ın SynthID-Text teknolojisine dayanan görünmez filigran yerleştirme planını inceliyor.

Filigran token seçimini nasıl değiştiriyor

SynthID-Text meta veri eklemiyor, turnuva örneklemesiyle her yeni tokenin nasıl seçildiğini değiştiriyor. Ağırlıklar ve prompt aynı kalıyor, token seçimi kalmıyor. JSON gibi yapılandırılmış çıktıda parantezler ve fonksiyon adları tahmin edilebilirken sorgular, sayılar ve yollar gibi değerler tahmin edilemiyor; düzyazıda zararsız görünen bir varyasyon, ajanın çalıştırdığı bir argümanı değiştirebiliyor. Lasso bunu sampling drift olarak adlandırıyor.

Yöntem dağılımı bozmuyor, ancak sabit bir anahtar altında tek tek üretimler yine de farklılaşıyor ve etki anahtara bağlı. Anthropic filigranı model düzeyinde uyguladığı ve buna Claude Platform API üzerinden erişilen modeller de dahil olduğu için, bu modeller üzerine kurulan ajanlar davranışı devralıyor.

Araç çağrıları doğruluktan daha fazla değişiyor

Eşleştirilmiş testlerde her öğe filigranlı ve filigransız üretildi. BFCL v4 benchmarkında filigran, yedi modelden altısında araç çağrısı doğruluğunu düşürdü. Lasso'nun churn dediği eşleştirilmiş uyuşmazlık oranı çok daha büyük: 1.0 sıcaklıkta phi-4'ün çağrı kararlarının %16,8'i yön değiştirirken doğruluk yalnızca 2,87 puan düştü; Llama-3.1-8B'de %9,9 churn'e karşılık 0,87 puanlık kayıp var. 21 kombinasyonda ortalama churn %6,5.

Şekil 2: model ve sıcaklığa göre eşleştirilmiş araç çağrısı uyuşmazlığı (Lasso Security)

Reddetme prompt injection altında zayıflıyor

İkinci deney, HarmBench'in 200 zararlı davranışını ve JailbreakBench'in 100 zararsız kontrolünü prompt injection tekniğiyle ve tekniğsiz test etti. Enjeksiyon altında gemma-3-27b'nin churn'ü %6,0'dan %23,5'e fırladı ve net uyum değişimi 1,0 puanlık düşüşten 12,5 puanlık artışa döndü. Filigran etkisi altı modelin dördünde sıcaklık etkisini aştı: T=0,7'de gemma-3-27b %26,0 ile %13,5'in karşısında.

Düzenleme ve öneri

EU AI Act'in 50(2) maddesi, sentetik metin üreten sistem sağlayıcılarından çıktıyı makine okunabilir biçimde ve AI üretimi olarak tespit edilebilir şekilde işaretlemesini istiyor. Lasso filigrana karşı değil; argümanı, kaynak kanıtı ile davranışsal kararlılığın ayrı olduğu. Önerisi: ajan değerlendirmesi ve red-teaming, üretime gidecek filigran yapılandırmasıyla ve prompt injection testleriyle tekrarlanmalı, çünkü anahtar sağlayıcının kontrolünde olabilir.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.