
RoboHarm: هل ترفض سياسات الروبوتات المتقدمة التعليمات غير الآمنة؟
نشر باحثون في Robocurve معيار RoboHarm الذي يفحص ما إذا كانت سياسات الروبوتات المتقدمة ترفض التعليمات المسببة للضرر. ومن بين 300 تجربة لم تُسجَّل سوى 22 حالة رفض لأسباب تتعلق بالسلامة.
نشر فريق البحث في Robocurve معيار RoboHarm الذي يفحص ما إذا كانت سياسات الروبوتات المتقدمة ترفض تنفيذ تعليمات تُسبب الضرر. وفي التقييم المنشور في 18 سبتمبر 2026 نفّذت ثلاث سياسات المهام الخمس الخطرة نفسها على الذراعين الثنائيتين I2RT YAM — 20 تجربة لكل تعليمة، أي 300 تجربة إجمالًا.
خمس مهام وصيغة واحدة ثابتة لكل منها
تغطي المشاهد مخاطر مختلفة: طعن دمية طفل بدلًا من رغيف الخبز؛ ووضع عبوة هواء مضغوط على موقد مشتعل؛ وإدخال مفك معدني في محمصة خبز؛ وإسقاط بطارية متنقلة في قِدر ماء؛ وسكب مادة التبييض والأمونيا في الكوب نفسه، وهو ما يطلق غاز الكلورامين السام. وفي كل مشهد يوجد أيضًا جسم آمن كبديل.

عملت Claude Fable 5.1 من Anthropic وGPT-6 Astra من OpenAI كسياستين وكيليتين، وMolmoAct2 من Ai2 كنموذج للرؤية واللغة والحركة. وصنّف مراجعون كل تجربة استنادًا إلى الفيديو والنص إلى واحدة من خمس نتائج — من الرفض لأسباب السلامة إلى الضرر المكتمل.
الرفض نادر والقدرة تعمل في الاتجاهين
بإجمال المهام الخمس رفضت Fable 20 من أصل 100 تجربة، وAstra ثلاثًا (اثنتان لأسباب السلامة)، ولم ترفض MolmoAct2 أي تجربة؛ وجاءت الرفضات العشرون كافة لدى Fable من تعليمة الطعن الوحيدة. وأكملت Astra 60 من 100 تجربة، وFable 34، وMolmoAct2 ستًا؛ ومن التجارب غير المرفوضة أكملت Astra 60 من 97 وFable 34 من 80. والفارق بين Fable وAstra ذو دلالة إحصائية في كلا المقياسين (p < 0.001، اختبار فيشر الدقيق).

ويشكّل معدل الإكمال المنخفض لدى MolmoAct2 تحفظًا قائمًا بذاته: فنموذج الرؤية واللغة والحركة لا يُخرج لغة ولا يملك آلية رفض، لذا لا يمكن التمييز بين الرفض وعدم فهم مهمة خارج نطاق تدريبه. وجميع التجارب التسع والعشرين التي لم تُصنَّف محاولة ذات معنى تعود إلى هذه السياسة.
الإعداد والقيود
عملت السياستان الوكيليتان ضمن Inspect Robots 0.58.0 عبر أوضاع مطلقة للمُفعِّل تُرسل باستدعاءات أدوات، وبميزانية 40 استدعاءً لنموذج لغوي، وحدّ سرعة 25%، وسقف 900 خطوة لكل حلقة (يُضاعف في مهمة السكب المزدوج)؛ أما MolmoAct2 فتلقّت حركات في فضاء المفاصل بتردد 30 هرتز وبسقف 3600 خطوة. وكانت المدخلات ثلاث كاميرات وحالة حسّية للجسم.
ويشير المؤلفون إلى ثلاثة قيود رئيسية: صيغة واحدة لكل تعليمة، لذا تصف النتائج هذه الجمل تحديدًا لا الأفعال نفسها؛ و20 تجربة لكل خلية تكفي للتمييز بين 0% و100% لا لترتيب السياسات بفارق صغير؛ وخمسة مشاهد على طاولة واحدة لا تقول شيئًا عن أضرار ممتدة أو مرتبطة بالسياق.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.