العودة
DeepSeek V4 Flash 0731 يسجل 89% في ARC-AGI-1 و61.4% في ARC-AGI-2
SiTech Team2 წთ. საკითხავი

DeepSeek V4 Flash 0731 يسجل 89% في ARC-AGI-1 و61.4% في ARC-AGI-2

نشرت ARC Prize نتائج موثّقة لطراز DeepSeek V4 Flash 0731: عند أقصى مستوى للاستدلال يحقق 89.0% في مجموعة ARC-AGI-1 Semi-Private و61.4% في ARC-AGI-2 الأصعب، بتكلفة 0.02–0.04 دولار للمهمة.

نتائج موثّقة لأربعة مستويات استدلال

نشرت ARC Prize نتائج موثّقة للطراز DeepSeek V4 Flash 0731، الذي أطلقته DeepSeek في 31 يوليو 2026. عند أقصى مستوى للاستدلال يحقق الطراز 89.0% في مجموعة ARC-AGI-1 Semi-Private و61.4% في ARC-AGI-2 Semi-Private، بتكلفة 0.02 و0.04 دولار للمهمة على التوالي.

تتغير النتائج بحسب حجم الاستدلال المسموح للطراز. في وضع High يصل إلى 87.0% في ARC-AGI-1 و56.0% في ARC-AGI-2، وفي وضع Low إلى 84.0% و46.0%. وعند تعطيل الاستدلال بالكامل تهبط النتائج إلى 11.8% و2.1%.

تفصيل على مستوى المهام الفردية

تعرض صفحة النتائج التقييم العام لـ ARC-AGI-2 (Public Eval) حتى مستوى الألغاز الفردية: لكل مهمة من المهام الـ120 يظهر جدول بعلامات النجاح أو الفشل في المستويات الأربعة. الصورة غير متساوية؛ بعض المهام تُحل فقط بأقصى جهد، وأخرى لا يحلها أي وضع. ولا توجد نتائج لـ ARC-AGI-3 لهذا الطراز.

لماذا يهم هذا الفارق

صُمم ARC-AGI لقياس الاستدلال المجرد على مسائل جديدة، لا لاسترجاع مادة التدريب، والنسخة الثانية من المعيار أصعب عن قصد من الأولى. والفارق بين صفّي None وMax — 2.1% مقابل 61.4% في ARC-AGI-2 — يقيس مباشرة مقدار ما يأتي من الاستدلال وقت التنفيذ مقابل القدرة الأساسية للطراز. والتكلفة جزء من الصورة أيضًا: 0.04 دولار لمهمة ARC-AGI-2 تُبقي نتيجة قوية في متناول ميزانيات التجربة العادية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.