العودة
اعتراض على تحكيم هاكاثون AGI من Kaggle بسبب «تناقضات صارخة»
SiTech AI Team3 წთ. საკითხავი

اعتراض على تحكيم هاكاثون AGI من Kaggle بسبب «تناقضات صارخة»

شارك متسابق في هاكاثون Measuring Progress Toward AGI من Google DeepMind اعتراضًا علنيًا على اختيار الفائزين: استخدام ضعيف لأداة التقييم الإلزامية، ونتائج متناقضة، ودرجات غير معلنة.

أُعلنت أسماء الفائزين في هاكاثون Measuring Progress Toward AGI — Cognitive Abilities، وهي مسابقة مميّزة نظّمتها Google DeepMind على منصة Kaggle، في منتصف يوليو. قدّم أكثر من 1000 فريق اختبارات معيارية في خمسة مسارات معرفية. وبعد أيام قليلة نشر أحد المشاركين اعتراضًا علنيًا مفصّلًا على طريقة منح الجوائز.

مضمون الشكوى

في تعليق نُشر أسفل إعلان النتائج، قال المشارك إنه يقدّم «أدلة على تناقضات صارخة في عملية التقييم واختيار الفائزين». ويركّز المنشور أساسًا على MEDLEY-BENCH، وهو اختبار معياري للوعي الفوقي السلوكي فاز بواحدة من أربع جوائز كبرى قيمتها 25 ألف دولار لكل منها.

ويرى المنتقد أن العمل يستخدم أداة Kaggle Benchmarks SDK، وهي إلزامية في المسابقة، استخدامًا سطحيًا إلى حدّ يُظهر فيه شاشة مقارنة النماذج درجة واحدة فقط دون أي بيان عن طريقة جمع البيانات، وأن النص يضم «ادعاءات غير مسندة». والمثال الرئيسي: تقول النتيجة رقم 1 إن توسيع حجم النموذج يرفع مؤشر «التقييم» بينما يبقى مؤشر «الضبط» ثابتًا، مع أن الخطين في الرسم البياني يرتفعان معًا. ويشير التعليق إلى أن الورقة التكميلية للفريق نفسه، وعددها 20 صفحة، تفيد بأن مقاييسه الأساسية مترابطة بدرجة عالية (ρ = 0,79–0,94)، وأن استنتاجًا لاحقًا يناقض الادعاء الجوهري السابق. ويضيف الكاتب أن العمل حُشِي بمواد إضافية: مقطعا فيديو مولّدان بالذكاء الاصطناعي، وبودكاست بالذكاء الاصطناعي، وموقع إلكتروني، وورقة على arXiv.

مطالب بالشفافية في الدرجات

طرح مشاركون آخرون أسئلة أضيق. طلب أحدهم من المنظمين نشر درجات التقييم — ويُفضَّل جدول كامل لكل المشاركات، أو على الأقل درجات الأعمال الفائزة — بحجة أن هاكاثون يقوم على قياس القدرات المعرفية لا الإعلان عنها ينبغي أن يطبّق المعيار نفسه على تحكيمه. وقارن آخر بين اختبارات مسار التعلّم عبر إحصاء عدد المرات التي شغّل فيها المنظمون نماذجهم الخاصة عليها، واصفًا ذلك بمؤشر غير مباشر على مدى الاهتمام الممنوح لها، وسأل عن أي معيار معلن لم يستوفه عمله هو، ATLAS.

وقال عدة معلّقين إن التحقق من الأعمال الفائزة بالجائزة الكبرى صعب: إذ يعلن GAUGE نحو 200 عنصر لكنه يعرض تشغيلًا واحدًا فقط في واجهة الاختبار، كما يعرض Metaproteus درجة واحدة. وتعلّق اعتراض منفصل بالنطاق لا بالدرجات: فالدعوة شملت نماذج «تستنتج وتتصرف وتحكم»، لكن البنية العملية اقتصرت على خمسة مسارات معرفية وبصيغة سؤال وجواب في الغالب، فلم يبقَ مكان لاختبارات تقوم على التفاعل الفيزيائي.

لماذا يهم الأمر

ذهبت الجوائز الكبرى الأربع، وقيمتها 25 ألف دولار لكل منها، إلى MEDLEY-BENCH وLearningBench وGAUGE وMetaproteus، بينما وُزّعت عشر جوائز مسارات بقيمة 10 آلاف دولار على فئات الوظائف التنفيذية والتعلّم والوعي الفوقي والإدراك الاجتماعي والانتباه. وشكر المنظمون المشاركين، وقالوا إن جودة الأعمال جعلت التحكيم «بالغ الصعوبة». وتذكّر هذه الواقعة بأن نتائج الاختبارات المعيارية، والمسابقات التي تكافئها، لا تكون ذات قيمة إلا بقدر متانة الأدلة التي تسندها.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.