العودة
Microsoft ThinkingBox يقيّم وكلاء الذكاء الاصطناعي من خلال السجلات المتروكة في قاعدة البيانات
SiTech AI Team3 دقيقة قراءة

Microsoft ThinkingBox يقيّم وكلاء الذكاء الاصطناعي من خلال السجلات المتروكة في قاعدة البيانات

معيار ThinkingBox من Microsoft وHugging Face يختبر وكلاء الذكاء الاصطناعي في 507 عملية تجارية ذات حالة، ينفّذ كل مهمة 20 مرة، ويقيّم الحالة النهائية والتأثيرات الجانبية وليس فقط الردود النهائية.

الحالة وليس الكلمات

يقيّم معيار ThinkingBox من Microsoft وHugging Face وكلاء الذكاء الاصطناعي من خلال السجلات المتروكة في قاعدة البيانات وليس فقط من خلال استدعاءات الأدوات أو الصياغة النهائية. يشمل 507 عملية تجارية ذات حالة وينفّذ كل مهمة 20 مرة من backend نظيف. في حالة واحدة، استخدم الوكيل تسعة استدعاءات لأدوات تقنية مطبخ متأخرة بقيمة $745، ثم علّم تذكرة المندوب كمحلولة بينما ظل استثناء الشحنة مفتوحًا. الحالة المطلوبة كانت hold، مما يشير إلى فشل، وهو ما كان مقيّم استدعاءات الأدوات سيغفله.

كل محاولة تجري في جلسة MCP معزولة بحالة مهيأة حديثًا. يُسجّل كاشف التأثيرات الجانبية التغييرات، ويقارن القضاة الحتميون النتيجة بالنتيجة المطلوبة. إطار الاختبار ومجموعة البيانات متاحان على Hugging Face، وThinkingBox-Bench يعمل عبر OpenEnv. من بين 507 مهمة، تُقيَّم 477 بالحالة فقط، بينما تضيف 30 معايير استجابة للمتطلبات التي لا يمكن التقاطها بحالة قاعدة بيانات نظيفة.

الاتساق نتيجة منفصلة

يُعلن ThinkingBox عن pass@1 وpass@20 و20/20 الثابت. يقيس Pass@1 نسبة المحاولات الفردية الناجحة. يقيس Pass@20 المهام التي نجحت مرة واحدة على الأقل في 20 محاولة، بينما يحسب 20/20 الثابت المهام التي تنجح في كل محاولة. في المقارنة العامة، تصدّر Claude Opus 5.5 في pass@1 بنسبة 67,16%، تبعه Claude Opus 5 بنسبة 66,50% ثم GPT-5.4 بنسبة 65,36%.

غيّر التكرار الصورة. حلّ Kimi-K3 من أصل 507 مهمة 476 مهمة مرة واحدة على الأقل، أي 93,89%، لكن 68 مهمة فقط اجتازت جميع المحاولات العشرين، أي 13,41%. اجتاز Claude Opus 5 عدد 241 مهمة في جميع المحاولات العشرين، وهو نفس العدد الذي اجتازه Claude Opus 5.5. في تجربة 121 680 محاولة صالحة على 12 نموذجًا، فشلت 79 853 محاولة في الفحوصات القابلة للتنفيذ. من هذه الإخفاقات، اكتمل 67,24% بشكل نظيف، واستدعى أداة تغيير الحالة ولم يُبلغ عن خطأ الأداة النهائية. كشفت الفحوصات عن قيم حقول غير صحيحة في 77,61%، وتأثيرات زائدة في 43,30%، وتأثيرات مطلوبة مفقودة في 25,36%؛ هذه البيانات تتداخل مع بعضها.

العمل مع الأدوات والنشر

هيمن استخدام الأدوات على شارات الفشل بنسبة 79,9%، تبعه تحديثات الحالة غير الصحيحة بنسبة 10,3%، وقرارات المستخدم غير المكتملة بنسبة 7,0%، وغياب إجراءات تغيير الحالة بنسبة 2,9%. يصف المؤلفون هذا بأنه متوسطات غير مرجحة لنسب كل نموذج وشارات قابلة للملاحظة وليست تفسيرات سببية فريدة. وكلاء الذكاء الاصطناعي غالبًا ما يبدأون سير العمل لكنهم يفشلون في التعافي من أخطاء الأدوات أو الشروط المسبقة الفاشلة أو عمليات البحث الفارغة.

للنشر، يوصي المؤلفون بالتحقق من الحالة النهائية قبل التسليم، وتصنيف أخطاء الأدوات والنظام، وتقليل سطح الأدوات، وطلب تأكيد بشري للتغييرات صعبة التراجع. لم يقيسوا تأثير هذه التدابير على المعيار. يقيّم ThinkingBox أيضًا قيمة المهمة الموثوقة، المحسوبة من حملة 20× وعدد المهام التي اجتازت جميع المحاولات العشرين. بين النماذج التي لديها مهمة ثابتة 20/20 واحدة على الأقل، كانت أدنى الدرجات $6,80 لـ GPT-5.4، و$7,45 لـ GPT-6 Astra، و$7,80 لـ Claude Opus 5.5. هذه درجات نسبية وليست تكاليف سحابية فعلية. وفقًا للمعيار العام، جميع المهام إعادة بناء اصطناعية، وسير العمل والسياسات مبنية على أنماط وكلاء مؤسسات حقيقية؛ مستخدموها ليسوا حقيقيين.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.