العودة
SiTech Professional Insights
بحث: يمكن استعادة مسارات التفكير المخفية من كتل مشفرة في واجهات النماذج
SiTech Team2 წთ. საკითხავი

بحث: يمكن استعادة مسارات التفكير المخفية من كتل مشفرة في واجهات النماذج

تُظهر ورقة بحثية جديدة أن كتل التفكير المشفرة التي تعيدها واجهات Anthropic وOpenAI وGoogle قابلة للإعادة إلى نموذج أضعف، ما يكشف التفكير المخفي لنموذج متقدم دون تشغيل ضماناته.

ما توصلت إليه الدراسة

وفق ورقة لباحثين من MATS Research ومعهد ELLIS في توبنغن ومعهد ماكس بلانك للأنظمة الذكية وشركة Snyk ومؤسسات أخرى، يمكن استعادة التفكير الخاص من الآثار المشفرة التي تعيدها شركات الذكاء الاصطناعي إلى عملائها. فـ Anthropic وOpenAI وGoogle تعيد كتل "سلسلة التفكير" مشفرة يمكن إعادة استخدامها بين الجلسات والمستخدمين والنماذج.

لا تهاجم الطريقة النموذج الأقوى مباشرة. إذ يعيد الباحثون إرسال أثر أنتجه نموذج متقدم إلى نموذج "شقيق" أضعف، ويكسرون حماية النموذج الأضعف عبر jailbreak، فيستعيدون تفكير النموذج الأقوى المخفي نصاً صريحاً — دون تشغيل ضماناته ضد التقطير.

الاستخراج بنداءين لواجهة البرمجة

في أحد الأمثلة، يُمرَّر أثر تفكير لنموذج Claude Opus 4.8 — وهو كتلة thinking يبلغ طول توقيعها وحده نحو 36,180 حرفاً — إلى Claude Haiku 4.5 مع تعليمات بالمتابعة ونسخ التفكير المرفق حرفياً داخل وسمي <thinking-copy>. فيعيد النموذج الأضعف تفكير النموذج الأقوى خطوة بخطوة كنص صريح.

ما استُخرج من السجلات العامة

جمع المؤلفون 6,708 مسارات وكلاء متاحة علناً من GitHub وHugging Face، أنتجتها نماذج Claude وGPT وGemini ولا تزال تحتوي كتل تفكير مشفرة. وأسفر تطبيق خط فك التشفير على كل كتلة موقّعة عن 315,320 كتلة تفكير مُعاد بناؤها.

وبحصر التحليل في جلسات مستخدمين حقيقية لا تنتمي إلى اختبارات قياسية، سجّل الباحثون 704 عناصر خصوصية متمايزة: 62 مفتاح API و33 كلمة مرور و24 رمز وصول و30 عنوان بريد إلكتروني شخصي، إلى جانب أسماء وعناوين بريدية وروابط داخلية ومعرّفات تقنية. وجاء التوزيع كالتالي: 351 معرّفاً تقنياً و204 عناصر بيانات شخصية و126 بيانات دخول. وقد ظهر 64 من أصل 704 عناصر داخل كتل التفكير فقط، ولم تظهر أبداً في الجلسة المرئية.

تجارب إضافية

تصف الورقة أيضاً اختباراً مع Kimi-K3: فملء تفكير النموذج مسبقاً بنسبة 1% فقط من رموز تفكير Opus 4.8 حرّك إجابته المرئية نحو صياغة النموذج الأقوى، مع أن الإجابة نفسها لم تُملأ مسبقاً قط. وفي تجربة أخرى، أدى تكليف نموذج بالتفكير في محتوى ضار مع إبقاء إجابته المرئية غير مؤذية إلى بقاء المعرفة الخطرة داخل الأثر المخفي، حيث استعادتها الهجمة كنص صريح. ويشير المؤلفون كذلك إلى عدم أمانة الملخصات: ففي بعض مسائل AIME يذكر Opus 4.8 الإجابة قبل استنتاجها، ولا يحفظ ملخص الواجهة هذا التمييز دائماً، فيبدو التفكير اشتقاقاً نظيفاً.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.