العودة
لماذا تكذب مقاييس تقييم وكلاء AI على الفرق
SiTech AI Team2 წთ. საკითხავი

لماذا تكذب مقاييس تقييم وكلاء AI على الفرق

تقيس مقاييس الدقة ونسب إنجاز المهام ودرجات نماذج المكافأة ما فعله وكيل AI، لا ما كان ينبغي أن يفعله. لذلك تتجه الفرق إلى التحقق من الحالة النهائية للعالم بدلاً من قياس سلوك الوكيل وحده.

تُطلق وكيل AI إلى الإنتاج. يجتاز كل الاختبارات والمعايير، ولوحة المراقبة هادئة. بعد ثلاثة أسابيع يبلغ مستخدم أن الوكيل يتخذ في الإنتاج قرارات خاطئة بشكل كارثي، ولم يكشف أي مقياس عنها. في تحليل نُشر على منصة DEV Community، يرى الكاتب Tamizuddin أن هذه غالباً ليست علّة في النموذج بل علّة في القياس.

فخ المقاييس البديلة

معظم خطوط تقييم الوكلاء مكدّسة من مقاييس بديلة: الدقة، وprecision، وrecall، ودرجات نموذج المكافأة، ونسب إنجاز المهام. حسابها رخيص والتلاعب بها سهل، لأنها تقيس ما فعله الوكيل لا ما كان ينبغي أن يفعله.

النماذج اللغوية احتمالية وسياقية وموجّهة نحو الأهداف، والوكلاء المبنيون عليها أكثر من ذلك، ومع ذلك تُقيَّم بمقاييس حتمية وساكنة مستعارة من التعلّم المُشرَف. دقة بنسبة 99% على مجموعة بيانات لا تمنع فشلاً كارثياً في المدخلات غير المألوفة. وقد تُعدّ المهمة مكتملة حتى عندما يحذف الوكيل الملف الخطأ أو يخالف السياسات. أما درجات نموذج المكافأة فترث ضجيج التفضيلات البشرية وتحيّزها. والمشكلة الأعمق أن الوكلاء لا يحسّنون أداءهم وفق مقياسك بل وفق البيئة، وأي فجوة بين الاثنين ستُستغل.

قياس النتائج لا المخرجات

البديل هو التوقف عن قياس ما يقوله الوكيل أو يفعله والبدء بقياس ما يحدث بسببه. في التعلّم المعزّز هذا المعيار قديم: العائد، أي المكافأة التراكمية خلال حلقة حقيقية أو محاكاة. وفي تقييم الوكلاء استُعيض عنه بمكافآت بديلة، لأن النتائج الحقيقية مكلفة أو بطيئة أو خطرة الملاحظة.

الإصلاح المقترح سطر واحد: استبدل كل مقياس بالتحقق من الحالة النهائية للعالم. يجب أن يكون المقياس الأساسي مُحقِّقاً للحالة لا مُصنِّفاً للسلوك، وأن يُعرَّف النجاح في البيئة لا في النص. "إن لم تستطع تعريف الحالة النهائية فأنت لا تعرف ما تبنيه"، كما يكتب الكاتب. تبقى المقاييس البديلة مفيدة للتكرار السريع، لكن كراية حمراء لا كضوء أخضر.

ثمن أرخص إشارة

تتطلب النتائج الحقيقية بيئات حقيقية وبيانات حقيقية وعواقب حقيقية، ولهذا تلجأ معظم الفرق إلى القواعد الاستكشافية أو مطابقة الكلمات المفتاحية أو درجة مبنية على نموذج. هذا مقبول للتكرار وقاتل عند الإطلاق. الإصلاح ثقافي بقدر ما هو تقني: تعامل مع كل مقياس كمشتبه به حتى تثبت براءته، واسأل عن كل واحد: لو كان هذا المقياس مثالياً، هل يمكن للوكيل أن يسبب ضرراً؟ وللبداية يُنصح بتهيئة البيئة للقياس: سجّل الحالة النهائية بعد كل تشغيل واكتب تحققات لثلاث إلى خمس ثوابت حرجة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.