
מחקר של Lasso Security: סימני מים ב-LLM משנים התנהגות סוכני AI
ניתוח של Lasso Security מראה שסימני מים בתוצרי מודלים משנים את אופן קריאת הכלים של סוכני AI ואת יציבות הסירוב לבקשות מזיקות, במיוחד כאשר מתלווה לכך prompt injection.
ניתוח של Lasso Security טוען שסימני מים בטקסט, שאמורים להוכיח שתוכן נוצר בידי מודל AI, משנים גם את התנהגות המודל עצמו. המחקר פורסם ב-17 בספטמבר 2026 ובוחן את תוכניתה של Anthropic להטביע סימן מים בלתי נראה במודלי Claude העתידיים, על בסיס SynthID-Text של Google DeepMind.
איך סימן המים משנה את בחירת הטוקנים
המנגנון עצמו יוצר את תופעת הלוואי: SynthID-Text אינו מוסיף מטא-נתונים, אלא משנה בדגימת טורנירים את אופן הבחירה של כל טוקן עוקב. המשקלים והפרומפט נשארים זהים, בחירת הטוקנים כבר לא. בפלט מובנה כמו JSON הסוגריים ושמות הפונקציות צפויים מאוד, בעוד ערכים כמו שאילתות, מספרים ונתיבים אינם צפויים, ולכן וריאציה שנראית תמימה בפרוזה יכולה לשנות ארגומנט שהסוכן מבצע. Lasso מכנה זאת sampling drift.
השיטה אינה מעוותת את התפלגות הטוקנים, אך תחת מפתח קבוע יצירות בודדות עדיין שונות, וההשפעה תלויה במפתח. מכיוון ש-Anthropic מחילה את סימן המים ברמת המודל, כולל דרך Claude Platform API וספקי ענן, סוכנים שנבנים על המודלים האלה יורשים את ההתנהגות הזו.
קריאות לכלים משתנות יותר ממה שמראה הדיוק
החברה ערכה ניסויים מזווגים שבהם כל פריט נוצר עם SynthID ובלעדיו מאותה seed. בבנצ׳מרק BFCL v4 ירד דיוק קריאות הכלים בשישה משבעה מודלים. אי-ההסכמה המזווגת, ש-Lasso מכנה churn, גדולה בהרבה: בטמפרטורה 1.0 החליפו 16.8% מהכרעות הקריאה של phi-4 כיוון, בעוד הדיוק ירד ב-2.87 נקודות, ו-Llama-3.1-8B הציג 9.9% churn מול הפסד של 0.87 נקודות. ב-21 צירופים עמד ה-churn הממוצע על 6.5%.
הסירוב נחלש תחת prompt injection
הניסוי השני כיסה 200 התנהגויות מזיקות מ-HarmBench ו-100 בקרות שפירות מ-JailbreakBench, עם טכניקת prompt injection קבועה ובלעדיה. תחת הזרקה זינק ה-churn של gemma-3-27b מ-6.0% ל-23.5%, והשינוי נטו בציות עבר מירידה של 1.0 נקודה לעלייה של 12.5 נקודות. ההשפעה עלתה על זו של שינוי טמפרטורה בארבעה משישה מודלים: ב-T=0.7 הציג gemma-3-27b 26.0% לעומת 13.5%.
רגולציה והמלצה
סעיף 50(2) לחוק ה-AI של האיחוד האירופי מחייב ספקים של מערכות שמייצרות טקסט סינתטי לסמן את הפלט באופן קריא למכונה ולהפוך אותו לזיהוי כנוצר בידי AI. Lasso אינה מתנגדת לסימני מים, אך טוענת שהוכחת מקור ויציבות התנהגותית הן תכונות נפרדות, וממליצה לחזור על הערכת סוכנים ו-red-teaming בתצורה שתלך לפרודקשן, עם השוואות מזווגות ובדיקות prompt injection, שכן המפתח עשוי להימצא בידי ספק המודל.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.