
DeepSeek V4 Flash 0731: 89% ב-ARC-AGI-1 ו-61.4% ב-ARC-AGI-2
ARC Prize פרסמה תוצאות מאומתות ל-DeepSeek V4 Flash 0731: ברמת החשיבה המקסימלית המודל מגיע ל-89.0% בסט ARC-AGI-1 Semi-Private ול-61.4% ב-ARC-AGI-2 הקשה יותר, בעלות של 0.02–0.04 דולר למשימה.
ארבע רמות חשיבה, תוצאות מאומתות
ARC Prize פרסמה תוצאות מאומתות עבור DeepSeek V4 Flash 0731, המודל ש-DeepSeek שחררה ב-31 ביולי 2026. ברמת החשיבה המקסימלית הוא משיג 89.0% בסט ARC-AGI-1 Semi-Private ו-61.4% ב-ARC-AGI-2 Semi-Private, בעלות של 0.02 ו-0.04 דולר למשימה בהתאמה.
התוצאות תלויות בכמה משאבי חשיבה מותר למודל להשקיע. במצב High הוא מגיע ל-87.0% ב-ARC-AGI-1 ול-56.0% ב-ARC-AGI-2; במצב Low — ל-84.0% ול-46.0%. כשהחשיבה מושבתת לחלוטין, הביצועים צונחים ל-11.8% ול-2.1%.
פירוט ברמת המשימות הבודדות
בעמוד התוצאות מפורטת ההערכה הציבורית של ARC-AGI-2 (Public Eval) עד לרמת החידות הבודדות: עבור כל אחת מ-120 המשימות מוצג סימון עבר/נכשל בכל אחד מארבעת המצבים. התמונה אינה אחידה — חלק מהמשימות נפתרות רק במאמץ מקסימלי, ואחרות אינן נפתרות באף מצב. תוצאות ARC-AGI-3 אינן מופיעות עבור המודל.
למה הפער הזה חשוב
ARC-AGI נועד למדוד חשיבה מופשטת על בעיות חדשות ולא שליפה של חומר מהאימון, והמהדורה השנייה של הבנצ'מרק קשה בכוונה מהראשונה. הפער בין שורת None לשורת Max — 2.1% מול 61.4% ב-ARC-AGI-2 — מראה ישירות כמה מהתוצאה נובע מחשיבה בזמן ריצה ולא מיכולת בסיסית של המודל. גם המחיר חלק מהסיפור: 0.04 דולר למשימת ARC-AGI-2 מציב תוצאה חזקה בטווח של תקציב ניסויים שגרתי.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.