
باحثو Google يقاومون حفظ اختبارات الوكلاء الذكاء الاصطناعي ذاتية التحسين
قدمت Google Cloud AI Research والجامعات طريقة RRSI التي تنظم كيفية إعادة كتابة وكلاء الذكاء الاصطناعي لأطر عملهم، وتمنع حفظ الاختبارات وتقلل تكلفة الرموز بنحو 30%.
نشرت Google Cloud AI Research وعدة جامعات ورقة بحثية تصف طريقة تحمي وكلاء الذكاء الاصطناعي ذاتية التحسين من حفظ مهام الاختبار وتقلل أيضاً تكاليف الحوسبة. يُطلق على النهج اسم RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) وهو لا يستهدف النموذج نفسه بل الطبقة البرمجية المحيطة بالنموذج اللغوي.
التحسين الذاتي يؤدي إلى الحفظ
يُغلّف وكلاء الذكاء الاصطناعي المعاصرون نموذجاً لغوياً ثابتاً داخل إطار عمل (harness) يضم المطالبات وسير العمل والأدوات والذاكرة والمنطق، ويتحكم فيما يراه النموذج في كل خطوة. وفقاً للورقة البحثية، فإن جزءاً كبيراً من التقدم الأخير في الوكلاء تم تحقيقه من خلال العمل على إطار العمل وليس بنماذج جديدة. تُتمت الطرق الأحدث هذه الدورة وتمنح النموذج اللغوي القدرة على إعادة كتابة إطار العمل بنفسه بناءً على التغذية الراجعة من مهام الاختبار، وهو ما يُشكّل شكلاً عملياً من التحسين الذاتي التكراري.
وجد الباحثون مشكلة واحدة. بما أن الوكيل يعمل على نفس مهام الاختبار المحدودة، فإنه في النهاية يحفظها عن ظهر قلب. ترتفع الدرجات في مهام التدريب، بينما يتضاءل التقدم في المهام الجديدة غير المرئية أو يختفي تماماً. تحفظ عملية البحث القوالب المُكيّفة مع معيار واحد فقط، وتمنح الأفضلية للمرشحين ذوي الدرجات الجيدة بالصدفة وتُضيف تعقيداً غير ضروري، مما يرفع درجات الاختبار دون أن يجعل الوكيل أفضل.
ميزانيات صغيرة وناقد صارم
يعمل RRSI على جانبي دورة التحسين ويترك إطار العمل قابلاً للتحرير بالكامل. تحدّد الميزانية عدد التغييرات المستقلة التي يمكن للمرشح دمجها في وقت واحد، وتتناقص هذه الميزانية مع مرور الوقت. تتيح الجولات المبكرة إعادة كتابة أكبر، بينما تسمح الجولات المتأخرة فقط بتغييرات صغيرة مرتبطة بشكل واضح بالنتيجة. يتتبع النظام المحاولات السابقة لتجنب تكرار نفس الأفكار الفاشلة، وعند توقف التقدم يجري تجارب متعمدة على الأجزاء القابلة للتغيير من إطار العمل.
عند اختيار التغييرات، يراجع الناقد جميع المقترحات ويرفض كل ما يربط مباشرة بأسماء المهام أو الحلول أو غيرها من الحيل المُكيّفة مع المعيار. هناك قاعدة أخرى لا تقبل التكلفة الحوسبية الأعلى إلا في حالة زيادة قابلة للقياس في النتيجة، بينما تتم إزالة المكونات غير المجدية بالفعل.
نمو في المهام غير المرئية
اختبر الفريق RRSI على ثمانية معايير تغطي البرمجة والعمل المكتبي الوكيلي والتصميم الهندسي؛ تم تجميد Claude Opus 4.8 طوال فترة الاختبار. حقق RRSI حتى 14,1 نقطة في مهام التدريب، وحتى 4,7 نقطة في خمسة معايير غير مرئية، مع استهلاك رموز أقل بنحو 30% أثناء التشغيل مقارنة بالنسخة غير المنظّمة. لم ينخفض الأداء الإجمالي عن المستوى الأساسي في أي معيار غير مرئي، بينما سُجلت أكبر زيادة قدرها 4,7 نقطة في JobBench.
عملت جميع الطرق المقارنة بشكل جيد في مهام التدريب، لكن النتائج تغيرت في المهام الجديدة وظهر طريقان دون مستوى إطار العمل الأساسي. أظهر RRSI أصغر زيادة بين جميع المتغيرات في مهام التدريب، وكان الطريقة الوحيدة التي تفوقت بشكل ملحوظ على المستوى الأساسي في المهام غير المرئية.
ارتفع إطار عمل البرمجة المُحسَّن بـ Gemini 3.5 Flash من 11,2 إلى 14,6 نقطة دون تغيير دقة Gemini 3.1 Flash Lite الأضعف بكثير، مما يشير إلى أن الآليات المكتشفة لا تعتمد على قدرات النموذج الذي استُخدم لاكتسابها. يشير المؤلفون إلى أن البحث يغطي فقط أطر العمل المحيطة بالنماذج المجمدة ولا يتناول تغيير أوزان النموذج. الكود متاح على GitHub.
أعمال ذات صلة
أطر العمل المصنوعة يدوياً غالباً ما تفشل في التعميم. أظهرت الاختبارات التي أُجريت على ARC-AGI-3 أن Opus 4.6 يجمع 97,1% في بيئة مألوفة، بينما يحصل على 0% في بيئة غريبة مع إطار عمل مصمم خصيصاً. قدّمت Nvidia قبل فترة قصيرة SoL-Pi، حيث يعيد وكيل بحثي بناء أطر عمل وكلاء البرمجة تلقائياً ويقلل تكلفة الرموز بنسبة تصل إلى 49% دون تدهور ملحوظ في النتائج. قبل ذلك بقليل، أجبرت Google الوكلاء على رؤية أحلام حول جلسات البحث السابقة لتحسين استراتيجية البحث لديها، وتركت النموذج دون تغيير.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.