
JevBench v1.4.1: מבחן בר-שחזור למודלים של החלטות מטיפוס מוגדר
Benchmark Heaven פרסמה את JevBench v1.4.1, מבחן בר-שחזור למודלים של החלטות מטיפוס מוגדר, עם 82 מערכות שנבחנו על 534 החלטות פומביות ו-308 החלטות סגורות. Jev 1.13.0 של TypeSafe AI מוביל עם 63.3 נקודות.
Benchmark Heaven פרסמה את JevBench v1.4.1 — מבחן בר-שחזור למודלים של החלטות מטיפוס מוגדר: מערכות שמקבלות מצב וסט כללים תחום ומחזירות תשובה מטיפוס קבוע מראש. הגרסה, שנמדדה ב-23 בספטמבר 2026, בחנה 82 מערכות על 534 החלטות פומביות ו-308 החלטות סגורות; 77 מהן מדורגות. בראש הרשימה Jev 1.13.0 של TypeSafe AI עם 63.3 נקודות, ומאחוריו — בהפרש 1.3 נקודות בלבד — השחזור הפתוח JevK5 v0.2.0.
איך מחושבת התוצאה
JevBench מאחד ארבעה צירים — תבונה, כיול, מהירות ועלות — כל אחד בסולם 0–100 — בממוצע הרמוני שווה-משקל. שני ספים מוסיפים לרדת מערכות לא מאוזנות: ציון נמוך מ-50 בתבונה, במהירות או בעלות מוריד את התוצאה בריבוע, ופער דיוק של יותר מ-25 נקודות אחוז בין הפריטים הפומביים לסגורים מפחית את התבונה. התוספת האחרונה היא הסט הסגור: 308 החלטות פרטיות חדשות תורמות 20% מציון התבונה, ורק מצרפים ברמת המערכת מתפרסמים — טקסט הפריטים, התשובות והתוצאות לכל פריט נשארים פרטיים ומתחלפים בין גרסאות. סיכוי ניחוש אקראי בסט הסגור: 29.3%.
הדירוג
Jev 1.13.0 משיג 63.3 (תבונה 53.1, כיול 76.3, מהירות 83.3, עלות 52.0) במחיר 0.040 דולר לאלף החלטות. אחריו JevK5 v0.2.0 (62.0, כ-0.022 דולר לפי הערכה), Hopper (59.4), Winnow-12B Q8 (55.6), reflex 4B (54.0) ו-djev (52.2, מחיר מוצהר 0.026 דולר). המודל הכללי החזק ביותר, GPT-6 Luna, מחזיק בתבונה הגבוהה בשדה, 97.4, ובדיוק הסגור הטוב ביותר, 95.5%, אך מדורג רק במקום ה-30: ציוני מהירות (72.6) ועלות (36.0) נמוכים אינם ניתנים לקיזוז בממוצע ההרמוני.
מה זה אומר על מודלים מטיפוס Jev
הפריטים הפומביים כמעט רוויים למובילים — Jev 1.13.0 עונה נכון על 86.6% מהם — ואילו הסט הסגור קשה בהרבה, 36.7%. פערים של כ-48–57 נקודות במערכות המובילות מפעילים את עונש ההכללה. הערות המבחן עצמו מכנות את 534 ההחלטות פיילוט, מציינות שהוא באנגלית בלבד ומזהירות שגם פריטי החבוי נשלחים לשירותים הנבחנים. התשתית, הפריטים הפומביים וכללי הניקוד — ברישיון MIT. שירות classifier.dev, שרץ על Jev, השיג 70.8 אך אינו מדורג, כי דירוגו היה מדרג את אותו מודל פעמיים. ניתוח בלתי תלוי שפורסם באותו יום טוען שההסתברויות של מודל החלטות אינן יכולות להישאר מכוילות על התפלגויות נתונים שרירותיות, ויש לראות בהן ציונים ולא הסתברויות.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.