Назад
Lasso Security: водяні знаки LLM змінюють поведінку AI-агентів
SiTech AI Team2 წთ. საკითხავი

Lasso Security: водяні знаки LLM змінюють поведінку AI-агентів

Аналіз Lasso Security засвідчив: водяні знаки в тексті моделей змінюють виклики інструментів і відмови агентів, а під prompt injection ефект стає значно сильнішим і менш передбачуваним.

Аналіз Lasso Security доводить, що текстові водяні знаки, покликані підтвердити походження контенту від AI-моделі, змінюють і поведінку самої моделі. Він присвячений планові Anthropic вбудувати невидимий знак у майбутні моделі Claude на основі SynthID-Text від Google DeepMind.

Як знак змінює вибір токенів

Побічний ефект створює сам механізм: SynthID-Text не додає метаданих, а його tournament sampling змінює те, як обирається кожен наступний токен. Ваги й prompt залишаються тими самими, вибір токенів ні. У виводі на кшталт JSON дужки та назви функцій передбачувані, а значення (запити, числа, шляхи) ні, тож варіація, безпечна в прозі, може змінити аргумент, який агент виконує. Lasso називає це sampling drift.

Метод не спотворює розподіл, проте за фіксованого ключа окремі генерації все одно відрізняються, і ефект залежить від ключа. Оскільки Anthropic застосовує знак на рівні моделі, зокрема через Claude Platform API, агенти на цих моделях успадковують таку поведінку.

Виклики інструментів змінюються сильніше, ніж показує точність

У парних тестах кожен елемент генерувався з SynthID і без нього з того самого seed. На бенчмарку BFCL v4 точність викликів знизилася в шести з семи моделей. Показник парних розбіжностей, який Lasso називає churn, значно більший: за температури 1.0 у phi-4 змінилися 16,8% рішень про виклик, тоді як точність впала на 2,87 пункту, а в Llama-3.1-8B churn сягнув 9,9% за втрати 0,87 пункту. У 21 комбінації середній churn становить 6,5%.

Рисунок 2: парні розбіжності викликів інструментів за моделями й температурою (Lasso Security)

Відмови слабшають під prompt injection

Другий експеримент охопив 200 шкідливих запитів HarmBench і 100 безпечних контрольних JailbreakBench: без ін'єкції та з технікою prompt injection. Під ін'єкцією churn gemma-3-27b стрибнув із 6,0% до 23,5%, а чиста зміна згоди перейшла від зниження на 1,0 пункту до зростання на 12,5. Ефект знака перевищив спричинений зміною температури в чотирьох із шести моделей: за T=0,7 gemma-3-27b дає 26,0% проти 13,5%.

Регуляція та рекомендація

Стаття 50(2) EU AI Act вимагає від постачальників систем, що генерують синтетичний текст, маркувати вивід у машиночитному форматі й робити його виявним як AI-генерований. Lasso не виступає проти водяних знаків: вона доводить, що походження і стабільність поведінки це різні властивості. Рада дослідників: повторювати оцінювання й red-teaming агентів у тій самій конфігурації, яка піде в продакшн, із парними порівняннями та тестами prompt injection, бо ключ може контролювати постачальник моделі.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.