
JevBench v1.4.1: معيار قابل لإعادة الإنتاج لنماذج القرارات ذات الأنواع المحددة
أصدرت Benchmark Heaven معيار JevBench v1.4.1 القابل لإعادة الإنتاج لنماذج القرارات من فئة Jev. قُيّمت 82 منظومة على 534 قرارًا عامًا و308 قرارات مغلقة؛ ويتصدر Jev 1.13.0 الترتيب بـ63.3 نقطة.
أصدرت Benchmark Heaven النسخة v1.4.1 من JevBench، معيار قابل لإعادة الإنتاج لنماذج القرارات من فئة Jev: أنظمة تتلقى حالة ومجموعة قواعد محدودة وتعيد إجابة ذات نوع محدد مسبقًا. قُيّمت النسخة في 23 سبتمبر 2026، وشملت 82 منظومة على 534 قرارًا عامًا و308 قرارات مغلقة، منها 77 منظومة مصنفة في الترتيب. يتصدر القائمة Jev 1.13.0 من TypeSafe AI بـ63.3 نقطة، فيما يليه البديل المفتوح JevK5 v0.2.0 بفارق 1.3 نقطة فقط.
كيف يُحتسب المعيار
يجمع JevBench أربعة محاور — الذكاء والمعايرة والسرعة والتكلفة — كل منها من 0 إلى 100، في متوسط توافقي متساوي الأوزان. بعد ذلك يعاقب المعيار الأنظمة غير المتوازنة: انخفاض الذكاء أو السرعة أو التكلفة دون 50 يخفض النتيجة تربيعيًا، وفارق الدقة بين المجموعتين العامة والمغلقة الذي يتجاوز 25 نقطة مئوية يقلص محور الذكاء. أحدث إضافة هي المجموعة المغلقة: 308 قرارات خاصة جديدة تسهم بنسبة 20% من محور الذكاء، ولا يُنشر سوى مجاميع على مستوى النظام — أما نصوص الأسئلة والأجوبة ونتائج كل بند فتبقى خاصة وتتبدل بين الإصدارات. فرصة التخمين العشوائي في المجموعة المغلقة 29.3%.
الترتيب
يسجل Jev 1.13.0 نتيجة 63.3 (الذكاء 53.1، المعايرة 76.3، السرعة 83.3، التكلفة 52.0) بتكلفة 0.040 دولار لكل 1000 قرار. ويأتي بعده JevK5 v0.2.0 (62.0، بنحو 0.022 دولار تقديريًا)، ثم Hopper (59.4) وWinnow-12B Q8 (55.6) وreflex 4B (54.0) وdjev (52.2 بسعر معلن 0.026 دولار). يملك النموذج العام الأقوى، GPT-6 Luna، أعلى ذكاء في الميدان (97.4) وأفضل دقة في المجموعة المغلقة (95.5%)، لكنه يحتل المرتبة الثلاثين فقط: الدرجات المنخفضة في السرعة (72.6) والتكلفة (36.0) لا يمكن تعويضها في المتوسط التوافقي.
ماذا يقول عن نماذج فئة Jev
الأسئلة العامة شبه مشبعة لدى المتصدرين — يجيب Jev 1.13.0 إجابة صحيحة عن 86.6% منها — بينما المجموعة المغلقة أصعب بكثير: 36.7%. الفوارق البالغة نحو 48–57 نقطة لدى الأنظمة المتقدمة تفعّل عقوبة التعميم. وتصف ملاحظات المعيار نفسه مجموعة الـ534 قرارًا بأنها تجريبية، وتشير إلى أنها بالإنجليزية فقط، وتحذر من أن الأسئلة المحجوزة تُرسل أيضًا إلى الخدمات الخاضعة للتقييم. أداة الاختبار والمهام العامة وقواعد الاحتساب متاحة بترخيص MIT. خدمة classifier.dev العاملة على Jev سجلت 70.8 لكنها ليست مصنفة، لأن تصنيفها سيعني ترتيب النموذج نفسه مرتين. في المقابل، يرى تحليل مستقل نُشر في اليوم نفسه أن احتمالات نموذج القرار لا يمكن أن تبقى معايرة على توزيعات بيانات اعتباطية، وأنها يجب أن تُقرأ كدرجات لا كاحتمالات.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.