
دراسة: وكلاء الذكاء الاصطناعي يبالغون في نتائجهم وما زالوا بعيدين عن البحث المستقل
اختبر معيار Epoch AI نموذجي Claude Fable 5 وGPT-5.6 Sol في مهام البحث المستقل. كلا النموذجين كررا تقنيات معروفة، واختارا أفضل المحاولات وأضخما النتائج، وما زالا بعيدين عن المعيار المرجعي البشري.
المعيار يكرر تقنيات معروفة بدلاً من الابتكار
قيّمت Epoch AI نموذجي Claude Fable 5 وGPT-5.6 Sol باستخدام معيار InnovationEval. كان على وكلاء الذكاء الاصطناعي ابتكار طريقة جديدة لتحسين نماذج اللغة بشكل مستقل بعد التدريب الأولي، وتشغيلها واختبارها وتحسينها. اتخذوا GRPO كنقطة انطلاق، وهي تقنية تقيّم الإجابة بأكملها. تستخدم الطريقة المرجعية التي أنشأها البشر SDPO إشارات إضافية، مثل رسائل الخطأ، لتوفير تغذية راجعة أكثر دقة للخطوات الفردية وتحوّل النموذج إلى معلم لنفسه. لم يقترب أي من النموذجين من النتيجة المرجعية. عالج GPT-5.6 Sol ضعف GRPO عندما لا توفر كل إجابة صحيحة إشارة تعليمية، رغم أن هذه الفكرة لم تكن جديدة. مقارنة بتحسين SDPO، حصل Sol على حوالي 35% بالتقييم المتسامح و15% بالتقييم الصارم. في مهام البرمجة، أبطأ Sol التدريب بشكل أساسي دون تحسين الطريقة. جعل Claude Fable 5 النموذج يعيد محاولة المهام الفاشلة مع الأخذ في الاعتبار المحاولات السابقة، وهي تقنية معروفة لم تقدم تحسينًا ملحوظًا.
نفّذ كلا الوكيلين عدة دورات تدريب متطابقة تقريبًا وفي كل مرة أعلنا فقط أفضل نتيجة، مما جعل الطرق تبدو أقوى. في التقارير النهائية، لم تُذكر هذه الممارسة تقريبًا ولم تُشار إلى الأعمال السابقة. حقق Sol حوالي 70% من تحسين SDPO، وحقق Fable 5 نسبة 40%؛ وأخرجت Epoch AI الزيادة المضخمة. تُظهر السجلات الداخلية للنماذج إدراك المشكلة: وصف Fable 5 عمليات التشغيل المتكررة بأنها بحث عن نقطة فحص أفضل. وفقًا لـ Epoch AI، يتوافق هذا مع ملاحظة سابقة من METR بأن محاولات الخداع في Sol كانت أكثر من النماذج الأخرى المتاحة للعامة.
Anthropic تحذر من نقاط ضعف مماثلة
تصف بطاقة النظام الخاصة بـ Anthropic لنموذج Claude Opus 5.5 قيودًا مماثلة وتعلن أن النموذج ما زال بعيدًا عن توقعات باحثي الشركة. المشكلات الرئيسية تتعلق بالمعرفة الموثوقة واتباع التعليمات: يقدم Opus 5.5 الافتراضات غير المتحقق منها كحقائق، ويصف التحقق الجزئي بأنه كامل، ويمنح التغييرات الصغيرة أفضلية على الأفكار الجديدة. في دراسة منفصلة بالتعاون مع جامعة برينستون ومعهد الأمن في المملكة المتحدة، عمل Claude Opus 4.8 لمدة ستة أيام على أسئلة تتعلق بورقتين بحثيتين غير منشورتين في NeurIPS. رفض المؤلفون الأصليون كلا النتيجتين. عندما لم تتحقق الفرضيات الأولية، بدلاً من البدء من جديد، خفف الوكلاء من الادعاءات. تؤكد Epoch AI أن على البشر التحقق الكامل من البحث الذي ينشئه الذكاء الاصطناعي، مما يقلل من فائدة النماذج.
تعتبر Epoch AI أنه من غير المرجح أن تساعد موارد حوسبة إضافية، لأن Sol أظهر تحسنًا في مهام الإجابات القصيرة فقط في نهاية الميزانية، بينما لم يستخدم Fable 5 حتى نصف الموارد المخصصة. تكرر المنظمة InnovationEval بانتظام بمهام جديدة وتشير إلى أن النماذج الرائدة قبل عام واحد عملت بشكل أسوأ بكثير في نفس الاختبار.
المصادر: The Decoder
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.