العودة
النماذج الأكبر ليست الحل: GPT-5.5 يهلوس بنسبة 86% مقابل 28% لـ GLM-5.2
SiTech AI Team2 წთ. საკითხავი

النماذج الأكبر ليست الحل: GPT-5.5 يهلوس بنسبة 86% مقابل 28% لـ GLM-5.2

تحليل على arrowtsx.dev يرى أن سباق المعاملات استنفد نفسه: النموذج المفتوح GLM-5.2 برخصة MIT يقترب من GPT-5.5 في المؤشرات ويتفوق عليه بوضوح في الأمانة، بمعدل هلوسة 28% مقابل 86% لدى GPT-5.5.

يتزايد تشكيك مختبرات الذكاء الاصطناعي الكبرى في افتراض أن النمو اللامحدود في عدد المعاملات وبيانات التدريب ينتج تلقائيًا نماذج أفضل. وفي تحليل نُشر على arrowtsx.dev في 18 يونيو، يرى الكاتب أن التوسّع وصل إلى سقفه، وأن الحجم الضخم بات مرتبطًا بمشكلة أخرى: نماذج لا تعترف بعدم معرفتها.

المؤشرات وسباق المعاملات

يبدأ النص بمثال غير معتاد: فقد قيّدت الحكومة الأميركية الوصول إلى Claude Fable 5 بعد ثلاثة أيام فقط من إطلاقه؛ ويصف الكاتب ذلك بأنه أول حظر أميركي لنموذج ذكاء اصطناعي لدواعي الأمن القومي، وقد جاء بسبب خطر اختراق واحد. في المقابل، يقترب النموذج المفتوح GLM-5.2 من شركة Z.ai (753 مليار معامل، منها نحو 40 مليارًا نشطة) من GPT-5.5 بفارق 4 نقاط فقط، ومن Fable 5 بفارق 9 نقاط في مؤشر Artificial Analysis Intelligence Index. أما Opus 4.8 وGPT-5.5 فهما نموذجان مغلقان ويُقدَّران بتحفّظ بين تريليون وتريليوني معامل. وعندما يقترب نموذج مفتوح برخصة MIT إلى هذا الحد من نموذج مغلق أكبر منه بمرة ونصف إلى مرتين، يستنتج الكاتب أن نمو الذكاء توقّف فعليًا.

معدلات الهلوسة

يتناول الجزء الثاني من التحليل مسألة الصدق. في اختبار AA-Omniscience يسجّل DeepSeek V4 Pro (1.6 تريليون معامل، منها 49 مليارًا نشطة) معدل هلوسة يبلغ 94%: ففي الأسئلة التي لم يعرف إجابتها اعترف بذلك في نحو 6% من الحالات فقط. أما GLM-5.2 فسجّل 28%، وOpus 4.8 نحو 36%، وFable 5 نحو 48%، وGPT-5.5 نحو 86%. ويرى الكاتب أن النماذج المدرّبة على كميات هائلة من البيانات الواقعية تتعلم دائمًا تقديم إجابة بدل قول "لا أعرف".

اختبار ومثلث غير محلول

لتوضيح ذلك، أُعطي النموذجان سؤالًا معقّدًا بلغة Python يتضمن خللًا معماريًا واضحًا، مع جهد استدلال مرتفع ودرجة حرارة 1، عبر OpenRouter. أنفق DeepSeek V4 Pro عددًا من رموز الاستدلال يقارب عشرة أضعاف ما أنفقه GLM-5.2، ومع ذلك قدّم إجابة خاطئة بثقة تامة. أما GLM-5.2 فقد احتاج نحو 12 ثانية و800 رمز استدلال ليدرك استحالة أن تنفّذ مهمة أحادية المسار إدخالًا وإخراجًا متعددًا دون التنازل عن السيطرة. وفي تجربة منفصلة، أهدر DeepSeek V4 Pro ثلاث دقائق و26 ثانية في حلقة استدلال قبل أن يقدّم حلًا منسّقًا جيدًا لكنه خاطئ.

الخلاصة أن تدريب النماذج واختيارها ينبغي أن يقوم على مثلث غير محلول: القدرة الخام، ومعايرة عدم اليقين، والكفاءة الحسابية. ويحذّر الكاتب من أن اختيار النموذج بحسب حجمه أو موقعه في لوحة الترتيب يعني بشكل متزايد اختيار نظام سيدافع بإقناع عن إجابة خاطئة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.