العودة →
SiTech Team⏱️ 1 წთ. საკითხავი

معهد أمن الذكاء الاصطناعي البريطاني: المعايير المعيارية تقلل بشكل منهجي من تقدير قدرات وكلاء الذكاء الاصطناعي الحقيقية

معهد أمن الذكاء الاصطناعي البريطاني: المعايير المعيارية تقلل بشكل منهجي من تقدير قدرات وكلاء الذكاء الاصطناعي الحقيقية

دراسة UK AISI على 7 معايير تُظهر أن ميزانيات الحوسبة الثابتة تقلل بشكل كبير من تقدير قدرات وكلاء الذكاء الاصطناعي الحقيقية — زيادة حد الرموز 10 أضعاف رفع معدل النجاح بنسبة ~25%.

🔍 لماذا تفشل المعايير في قياس القوة الحقيقية لوكلاء الذكاء الاصطناعي؟

نشر المعهد البريطاني لأمن الذكاء الاصطناعي (UK AISI) دراسة أصبحت واحدة من أهم النتائج في مجال تقييم الذكاء الاصطناعي. اختبر المعهد نماذج الذكاء الاصطناعي الرائدة على سبعة معايير مختلفة ووجد أن الاختبارات المعيارية تقلل بشكل منهجي من تقدير قدرات وكلاء الذكاء الاصطناعي.

السبب بسيط: كل معيار له ميزانية حوسبة ثابتة — الحد الأقصى لعدد الرموز التي يمكن لوكيل الذكاء الاصطناعي استخدامها. أثبت باحثو AISI أن أداء وكيل الذكاء الاصطناعي ليس نقطة ثابتة، بل منحنى ينمو مع زيادة وقت اختبار الحوسبة. عندما نقطع الميزانية بينما لا يزال هذا المنحنى في ارتفاع، تُظهر النتيجة الحد الأدنى وليس الحد الأقصى.

📖 اقرأ المقال كاملاً على The Decoder