
GLM-5.2 يتصدّر النماذج المفتوحة الأوزان في تصنيف Artificial Analysis
يحصل نموذج GLM-5.2 من Z.ai على 51 نقطة في مؤشر Artificial Analysis Intelligence Index v4.1 متقدماً على MiniMax-M3 وDeepSeek V4 Pro وKimi K2.6، ويقع على حدود باريتو بين الذكاء وكلفة المهمة.
أصبح GLM-5.2 من Z.ai النموذج المفتوح الأوزان الأبرز في مؤشر Artificial Analysis Intelligence Index بعد أن حصل على 51 نقطة في الإصدار 4.1 من المؤشر. ووفقاً لشركة التحليل، يحافظ النموذج على الحجم نفسه لسابقه GLM-5.1 — 744 مليار معامل إجمالاً و40 ملياراً نشطة — لكنه يضيف 11 نقطة في المؤشر.
موقعه في التصنيف
تضع هذه النتيجة GLM-5.2 أمام إصدارات أخرى مفتوحة الأوزان: يحصل MiniMax-M3 وDeepSeek V4 Pro (max) على 44 نقطة، بينما يبلغ Kimi K2.6 نحو 43. وفي مقياس GDPval-AA v2، المؤشر الأساسي لدى Artificial Analysis للأداء الوكيلي الواقعي، يسجل GLM-5.2 نحو 1524 نقطة مقابل 1418 لـ MiniMax-M3 و1328 لـ DeepSeek V4 Pro (max)، وهو في مستوى GPT-5.5 بوضع xhigh (1514) عملياً.
تحسّن في التقييمات
يظهر التحسّن مقارنةً بـ GLM-5.1 في معظم الاختبارات، ويأتي الاستدلال العلمي في المقدمة. يرتفع CritPt بمقدار 16 نقطة إلى 21 في المئة، وHLE بمقدار 12 نقطة إلى 40 في المئة، وSciCode بمقدار 7 نقاط إلى 50 في المئة. ويصعد AA-LCR بمقدار 9 نقاط إلى 71 في المئة، واختبار tau3 المصرفي بمقدار 15 نقطة إلى 27 في المئة، وTerminalBench v2.1 بمقدار 16 نقطة إلى 78 في المئة. أما GPQA Diamond فيرتفع 3 نقاط إلى 89 في المئة.
الكلفة والموثوقية
يقع GLM-5.2 أيضاً على حدود باريتو في مخطط الذكاء مقابل كلفة المهمة، أي إن لديه أدنى كلفة للمهمة بين النماذج عند مستوى ذكائه. وفي مؤشر AA-Omniscience يسجل 4 نقاط مقابل 2 لـ GLM-5.1: ترتفع الدقة من 24.2 إلى 25.1 في المئة، وينخفض معدل الهلوسة من 29.4 إلى 28.1 في المئة، بينما يبقى معدل المحاولة ثابتاً عند 47 في المئة. ويستهلك النموذج نحو 43 ألف رمز إخراج لكل مهمة في المؤشر، منها 37 ألفاً رموز استدلال.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.