العودة
البشر أفلتوا من كل تهديد ثالث عند الموافقة على أوامر وكيل الذكاء الاصطناعي
SiTech AI Team3 წთ. საკითხავი

البشر أفلتوا من كل تهديد ثالث عند الموافقة على أوامر وكيل الذكاء الاصطناعي

لعبة متصفح يوافق فيها اللاعبون على أوامر وكيل برمجي للذكاء الاصطناعي أو يرفضونها جمعت أكثر من 40 ألف جولة. أفلت اللاعبون من ثلث التهديدات بمتوسط دقة بلغ 66.3%.

تشير بيانات لعبة متصفح يوافق فيها اللاعبون على أوامر وكيل برمجي للذكاء الاصطناعي أو يرفضونها إلى أن مراجعة «الإنسان داخل الحلقة» حدّ أمني ضعيف. في تدوينة نُشرت في 5 أغسطس، يذكر المطوّر أليكس ووترز أن اللعبة أنتجت أكثر من 40 ألف جولة و409 آلاف قرار فردي بالموافقة أو الرفض. بعض الأوامر روتينية مثل git status أو npm test، وأخرى تشير إلى أن الوكيل قد اختُرق ويُرسل أسراراً إلى خادم بعيد. أفلت اللاعب المتوسط من تهديد واحد من كل ثلاثة، بمتوسط دقة 66.3%.

الأرقام الرئيسية

انتهى نحو ثلث الجولات — 32.9% — بنتيجة سلبية، أي إن غرامات الموافقة على تهديدات وحجب أوامر آمنة فاقت كل ما أُنجز بشكل صحيح. نجح نحو 35.2% من اللاعبين في التقاط كل التهديدات، لكن 20.8% فقط فعلوا ذلك مع حجب أوامر آمنة بحد أقصى واحد من كل خمسة؛ أما الباقون فوصلوا إلى ذلك جزئياً بحجب كل شيء. كما وافق 7% من اللاعبين على كل الطلبات. ويلاحظ الكاتب تحفظاً مهماً: نحو 34% من الأوامر في اللعبة كانت تهديدات، وهي نسبة أعلى بكثير من العمل اليومي، وإن كان ضغط الإصدار السريع في المشاريع الحقيقية قد يؤدي إلى موافقات متسرعة مماثلة.

أي التهديدات تمرّ

تباينت معدلات الإفلات بحدة حسب الفئة. الأوامر المدمّرة بوضوح مثل rm -rf / كانت الأكثر التقاطاً بنسبة إفلات 11.7%. والتعديلات الدائمة كحقن crontab أو اختطاف git config أُفلتت بنسبة 23.8%، وتسريب البيانات وتنفيذ الكود عبر استدعاءات curl إلى واجهات مجهولة وحزم بأسماء منتحلة بنسبة 33.4%، أما انتهاكات النطاق مثل قراءة ~/.aws/credentials فكانت الأكثر إفلاتاً بنسبة 35.0%. الأمر الأكثر إفلاتاً كان npm run analyze، إذ وافق عليه 64.7% من اللاعبين رغم أن سجل الأحداث أظهر سكربتاً مشبوهاً في package.json؛ وظهر npm run setup وnpm run deploy أيضاً ضمن العشرة الأوائل. وبشكل مجمّع أُفلتت أوامر npm run الثلاثة بنسبة 52.5% مقابل 28.4% لهجمات التسريب الأخرى.

الإرهاق والحجب المفرط

يُظهر التحليل أيضاً ارتفاع معدلات الإفلات قرب نهاية الجولات، وهو ما يتوافق مع «إرهاق الأذونات» الذي أقرّت به Anthropic بخصوص Claude Code: فكلما رأى المستخدم مزيداً من الموافقات، قلّ انتباهه لكل واحدة. والخطأ المعاكس شائع أيضاً: فقد رُفضت أوامر حميدة بانتظام، بينها إعداد مرآة داخلية عبر npm config set registry (حُجب 59% من المرات)، وrm -rf dist/ (45%)، وأمر لتحرير منفذ الخادم (43%). وكان الأمر الأكثر إثارة للجدل cat ~/.zshrc، الذي وافق عليه 45.9% من اللاعبين.

الخلاصة

يعترف الكاتب بأنها لعبة وليست دراسة أكاديمية، لكنه يرى أن التجربة تُظهر مشكلات الاعتماد على «الإنسان داخل الحلقة» كحدّ أمني لوكلاء الذكاء الاصطناعي: فالضجيج يُنشئ إرهاقاً، وكثيراً ما يفتقر المطوّرون إلى السياق للحكم على ما تغيّر، ويصبح تجاوز الموافقات مغرياً. وتوصيته هي الاستثمار في العزل البيئي (sandboxing) والعزل الصارم للسياق، ومنح الوكلاء أذونات واسعة فقط بعد توفر هذه الضمانات.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.