العودة
PAC-Bench: إلى أي مدى تبني النماذج لعبة Pac-Man من موجه واحد؟
SiTech AI Team3 წთ. საკითხავი

PAC-Bench: إلى أي مدى تبني النماذج لعبة Pac-Man من موجه واحد؟

طلب مهندس من 30 توليفة من النماذج وبيئات التشغيل بناء لعبة Pac-Man من موجه قصير واحد، دون توجيه إضافي ودون تدخل بشري. أفضل نتيجة بلغت 99 من 100 نقطة، بينما جمع أضعف مشاركة نقطتين فقط.

نشر مهندس معياراً عاماً باسم PAC-Bench يطرح على نماذج الذكاء الاصطناعي الرائدة سؤالاً واحداً: هل تستطيع بناء لعبة Pac-Man تعمل من موجه قصير واحد، دون توجيه إضافي ودون تدخل بشري؟ المهمة واحدة للجميع: «Create a Pac-Man game in a single html page». ويمكن لعب النتائج جنباً إلى جنب على صفحة المشروع.

ما الذي يقيسه المعيار

يقيّم التقرير 30 مشاركة ناتجة عن توليفات مختلفة من النماذج وبيئات التشغيل. حُكم على كل لعبة من 100 نقطة وفق خمسة معايير: التحكم (20)، الأشباح (25)، توقف Pac-Man (20)، المتاهة (20) والصوت (15). ووفقاً لصاحب المشروع، قام بالتقييم Opus 5.5 بعد مراجعة الألعاب الحية في 28 سبتمبر 2026، وليس النماذج نفسها.

أُنتجت المشاركات في بيئات أصلية مثل Claude Code وCodex وCursor Cloud وGrok Build، وفي Claude Code الموجّه إلى OpenRouter، وفي Antigravity مع Gemini. أُخذت الأزمنة وأعداد الرموز من نصوص البيئات؛ وإذا لم تسجل التجربة رقماً، يظهر شرطة في الجدول.

النتائج

تتصدر نماذج Anthropic أعلى الجدول. حلّ Claude Opus 5.5 أولاً بـ 99 نقطة، وأرجعت المراجعة إليه أفضل صوت في المجموعة: مقدمة كاملة من عبارتين مع خط باس، وصافرة متواصلة ترتفع مع التقدم، وصوت موت على طريقة الأركيد. وجاء Claude Fable 5.1 ثانياً بـ 96 نقطة، بينما تقاسم Claude Fable 5 وClaude Sonnet 5.5 العامل على OpenRouter 95 نقطة. ونال Grok 4.7 من xAI 94 نقطة، ووصل GPT-5.6 Sol من OpenAI إلى 90.

التوزيع أدنى من ذلك واسع. لم تبلغ 90 نقطة أو أكثر سوى ست مشاركات، ووسيط النتائج 58 نقطة، وأضعف مشاركة، MiniMax M3، جمعت نقطتين فقط. ولم تكن بعض الألعاب خشنة فحسب، بل غير قابلة للإكمال: في Grok 4.5 بقيت عشر كريات غير قابلة للوصول، وفي Kimi K2.7 Code من Moonshot لا يمكن الوصول إلى أي من 270 كرية من نقطة البداية.

أين تفشل النماذج

أكثر نقاط الضعف شيوعاً هو سلوك الأشباح. في 17 من أصل 30 مشاركة سجلت المراجعة عيباً جسيماً في معيار الأشباح: الأشباح الأربعة تتشارك المنطق نفسه، أو الأشباح المأكولة لا تعود إلى البيت، أو الأشباح مرسومة فوق الجدران. وسُجل في تسع مشاركات عيب جسيم في المتاهة، من كثرة الطرق المسدودة إلى تصاميم لا تشبه متاهة Pac-Man إطلاقاً.

تتفاوت الكلفة والسرعة بقدر تفاوت الجودة. كان GPT-6 Luna الأرخص بنحو 0,013 دولار، بينما كان Claude Fable 5 الأغلى بنحو 17,28 دولار. وكان Qwen 3.8 Max الأبطأ بـ 44 دقيقة، أما نسخة Grok Bot المكتوبة داخل المحادثة فانتهت في أقل من دقيقة.

لماذا يهم ذلك

مثل هذه الدرجات إشارة ضيقة. فاللعبة العاملة ليست مقياساً عاماً للتفكير، ويؤكد صاحب المشروع ذلك. ما يوضحه المعيار هو مدى اعتماد نتيجة مهمة تُنفَّذ مرة واحدة على البيئة المحيطة بالنموذج، وكم مرة يبدو الكود المولَّد صحيحاً لكن يتعذر لعبه حتى النهاية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.