מחקר: אפשר לשחזר את החשיבה הנסתרת של מודלים מקטעים מוצפנים ב-API
מאמר חדש מראה שקטעי שרשרת חשיבה מוצפנים שמוחזרים מ-API של Anthropic, OpenAI ו-Google ניתנים להשמעה במודל חלש יותר, ובכך נחשפת החשיבה הנסתרת של המודל החזק בלי להפעיל את הגנותיו.
מה מצא המחקר
לפי מאמר של חוקרים מ-MATS Research, מכון ELLIS בטיבינגן, מכון מקס פלנק למערכות אינטליגנטיות, חברת Snyk ומוסדות נוספים, אפשר לשחזר חשיבה קניינית מהעקבות המוצפנות שספקי ה-AI מחזירים ללקוחותיהם. Anthropic, OpenAI ו-Google מחזירים קטעי "שרשרת חשיבה" מוצפנים שניתנים להשמעה בין הפעלות, משתמשים ומודלים.
השיטה אינה תוקפת את המודל החזק ישירות. החוקרים משמיעים עקבה שהפיק מודל חזית אל תוך מודל אחות חלש ממנו, פורצים את המודל החלש באמצעות jailbreak ומשחזרים את החשיבה הנסתרת של המודל החזק כטקסט גלוי — בלי להפעיל את הגנות מניעת הזיקוק שלו.
חילוץ בשתי קריאות API
באחת הדוגמאות עקיבת חשיבה של Claude Opus 4.8 — בלוק thinking שחתימתו לבדה באורך כ-36,180 תווים — מועברת ל-Claude Haiku 4.5 יחד עם הנחיה להמשיך ולתעתק את החשיבה המצורפת מילה במילה בתוך תגיות <thinking-copy>. המודל החלש מחזיר את החשיבה שלב-אחר-שלב של המודל החזק כטקסט גלוי.
מה נמצא ביומנים פומביים
המחברים אספו 6,708 מסלולי סוכנים פומביים מ-GitHub ומ-Hugging Face, שנוצרו על ידי מודלי Claude, GPT ו-Gemini והכילו עדיין בלוקי חשיבה מוצפנים. הפעלת צינור הפענוח על כל בלוק חתום הניבה 315,320 בלוקי חשיבה משוחזרים.
כשהגבילו את הניתוח להפעלות אמיתיות שאינן בנצ'מרק, דיווחו החוקרים על 704 פריטים פרטיים שונים: 62 מפתחות API, 33 סיסמאות, 24 אסימוני גישה, 30 כתובות דואר אלקטרוני אישיות, וכן שמות, כתובות דואר, כתובות URL פנימיות ומזהים טכניים. לפי הפילוח: 351 מזהים טכניים, 204 פריטי מידע אישי ו-126 פרטי התחברות. 64 מתוך 704 הפריטים הופיעו רק בבלוקי החשיבה, ומעולם לא בהפעלה הגלויה.
ניסויים נוספים
המאמר מתאר גם מבחן עם Kimi-K3: מילוי מוקדם של החשיבה של המודל ב-1% בלבד מהאסימונים של חשיבת Opus 4.8 הסטה את תשובתו הגלויה לעבר הניסוח של המודל החזק, אף שהתשובה עצמה מעולם לא מולאה מראש. בניסוי אחר, הנחיה למודל לחשוב על תוכן מזיק בעוד תשובתו הגלויה נשארת תמימה הותירה את הידע המסוכן בעקבה הנסתרת, שממנה חילצה אותו המתקפה כטקסט גלוי. המחברים מציינים גם חוסר נאמנות בתקצירים: בכמה בעיות AIME מציין Opus 4.8 את התשובה לפני שהוא גוזר אותה, והתקציר שמוחזר מה-API לא תמיד משמר את ההבדל, כך שהחשיבה נראית כגזירה נקייה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.