
DeepSeek V4 Flash 0731: 89% на ARC-AGI-1 і 61,4% на ARC-AGI-2
ARC Prize опублікувала підтверджені результати DeepSeek V4 Flash 0731: за максимального рівня міркувань модель досягає 89,0% на наборі ARC-AGI-1 Semi-Private і 61,4% на складнішому ARC-AGI-2 — за 0,02–0,04 долара на задачу.
Підтверджені результати для чотирьох рівнів
ARC Prize опублікувала підтверджені результати DeepSeek V4 Flash 0731 — моделі, яку DeepSeek випустила 31 липня 2026 року. За максимального рівня міркувань вона набирає 89,0% на наборі ARC-AGI-1 Semi-Private і 61,4% на ARC-AGI-2 Semi-Private; вартість становить 0,02 і 0,04 долара на задачу відповідно.
Результати залежать від того, скільки ресурсу на міркування дозволено моделі. У режимі High вона досягає 87,0% на ARC-AGI-1 і 56,0% на ARC-AGI-2, у режимі Low — 84,0% і 46,0%. Якщо міркування вимкнути повністю, показники падають до 11,8% і 2,1%.
Розбивка за окремими задачами
На сторінці результатів публічна оцінка ARC-AGI-2 (Public Eval) розібрана до рівня окремих головоломок: для кожної зі 120 задач показано, пройдено її чи ні, в усіх чотирьох варіантах. Картина нерівномірна: частину задач розв'язує лише максимальний режим, інші не піддаються жодному. Результатів ARC-AGI-3 для цієї моделі немає.
Чому ця різниця важлива
ARC-AGI створений для вимірювання абстрактного мислення на нових задачах, а не пригадування даних із тренування, і друге видання бенчмарку навмисно складніше за перше. Розрив між рядками None і Max — 2,1% проти 61,4% на ARC-AGI-2 — прямо показує, яку частку результату дає міркування під час виконання, а не базові можливості моделі. Важлива й ціна: 0,04 долара за задачу ARC-AGI-2 робить сильний результат доступним для звичайних експериментів.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.