
«النماذج تزداد غباءً عن قصد»: لماذا تستبدل المختبرات المعرفة بالقدرة على الاستدلال
يقول كاتب مدوّنة إن مختبرات الذكاء الاصطناعي تستبدل عن قصد معرفة العالم بقدرة الاستدلال: النماذج تتحسن في الرياضيات والبرمجة لكنها تضعف في تذكّر الوقائع وترتفع فيها الهلوسة.
في تدوينة بعنوان “Models Are Getting Dumber on Purpose” يرى الكاتب أن المختبرات الرائدة تستبدل عن قصد معرفة العالم بالقدرة على الاستدلال: فالنماذج تحل مهام الرياضيات والبرمجة بحساب أقل لكل رمز، لكنها تضعف في تذكّر الوقائع.
مقاييس تشير إلى اتجاهين متعاكسين
وفق التدوينة، يحقق GLM-5.2 نسبة 99.2% في AIME 2026 بنحو 40 مليار معامل نشط لكل رمز، ويصل Qwen3.5 إلى 91.3% بـ17 مليارًا، بينما يعمل DeepSeek V4-Flash بـ13 مليارًا. وللمقارنة، نُسب إلى GPT-4 في 2023 نحو 280 مليار معامل نشط، وكان بالكاد يحل مسألة من AIME. أما Qwen3.5 9B فيتسع بعد التكميم في 6 جيجابايت من ذاكرة الرسوميات، ويضاعف تقريبًا نتيجة أفضل نموذج تالٍ دون 10 مليارات معامل في مؤشر الذكاء لدى Artificial Analysis. وتذكّر الوقائع يروي قصة معاكسة: في SimpleQA، حيث لا يُسمح بالأدوات، المتصدر هو Gemini 2.5 Pro بنسبة 53%، بينما تبلغ معدلات هلوسة Qwen3.5 4B و9B نحو 80%–82%.
الوقائع تتقادم، أما الإجراءات فلا
تُقدّر أبحاث سعة المعرفة، ومنها سلسلة “Physics of Language Models”، نحو بتّين من المعرفة الوقائعية لكل معامل. ويرى الكاتب أن الاستدلال يُضغط بشكل أفضل لأنه مجموعة صغيرة من الإجراءات تُطبّق مرارًا: تقسيم المسألة إلى أجزاء، وتتبّع الحالة الوسيطة، ومراجعة العمل، والرجوع عند الحاجة. أما Phi-4 فهو نموذج بـ14 مليار معامل دُرّب كثيرًا على بيانات اصطناعية بأسلوب الكتاب المدرسي: جيد في الرياضيات وضعيف في المعلومات العامة. وللوقائع عمر افتراضي، بينما لا يتقادم الجبر.
أين تقيم المعرفة الآن
إذا لم تعد النماذج تخزّن الوقائع، توفرها البنية الخارجية: الاسترجاع، واستدعاء الأدوات، والبحث في الويب، والوثائق. لا يحتاج وكيل البرمجة إلى حفظ واجهة مكتبة بعينها؛ فهو يبحث داخل node_modules أو يقرأ الوثائق، فيستند جوابه إلى الإصدار المثبَّت فعلًا. ويتوقع الكاتب أن يعمل استدلال بمستوى النماذج المتقدمة خلال بضع سنوات على بطاقة رسوميات استهلاكية واحدة: فـDeepSeek V4-Flash يستدل بالفعل بنحو 13 مليار معامل نشط، بينما تقع الـ271 مليارًا الأخرى غالبًا في طبقات الخبراء التي تُخزّن الوقائع. ولا يمكن تصحيح واقعة خاطئة مطبوعة في الأوزان دون ضبط دقيق، بينما للخطأ في مستند عنوان يمكن تصحيحه لتفيد كل الاستعلامات التالية. ويرجّح الكاتب أن تتوقف بطاقات النماذج يومًا عن ذكر تاريخ قطع المعرفة.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.