Назад
DeepSeek V4 Flash 0731: 89% на ARC-AGI-1 і 61,4% на ARC-AGI-2
SiTech Team2 წთ. საკითხავი

DeepSeek V4 Flash 0731: 89% на ARC-AGI-1 і 61,4% на ARC-AGI-2

ARC Prize опублікувала підтверджені результати DeepSeek V4 Flash 0731: за максимального рівня міркувань модель досягає 89,0% на наборі ARC-AGI-1 Semi-Private і 61,4% на складнішому ARC-AGI-2 — за 0,02–0,04 долара на задачу.

Підтверджені результати для чотирьох рівнів

ARC Prize опублікувала підтверджені результати DeepSeek V4 Flash 0731 — моделі, яку DeepSeek випустила 31 липня 2026 року. За максимального рівня міркувань вона набирає 89,0% на наборі ARC-AGI-1 Semi-Private і 61,4% на ARC-AGI-2 Semi-Private; вартість становить 0,02 і 0,04 долара на задачу відповідно.

Результати залежать від того, скільки ресурсу на міркування дозволено моделі. У режимі High вона досягає 87,0% на ARC-AGI-1 і 56,0% на ARC-AGI-2, у режимі Low — 84,0% і 46,0%. Якщо міркування вимкнути повністю, показники падають до 11,8% і 2,1%.

Розбивка за окремими задачами

На сторінці результатів публічна оцінка ARC-AGI-2 (Public Eval) розібрана до рівня окремих головоломок: для кожної зі 120 задач показано, пройдено її чи ні, в усіх чотирьох варіантах. Картина нерівномірна: частину задач розв'язує лише максимальний режим, інші не піддаються жодному. Результатів ARC-AGI-3 для цієї моделі немає.

Чому ця різниця важлива

ARC-AGI створений для вимірювання абстрактного мислення на нових задачах, а не пригадування даних із тренування, і друге видання бенчмарку навмисно складніше за перше. Розрив між рядками None і Max — 2,1% проти 61,4% на ARC-AGI-2 — прямо показує, яку частку результату дає міркування під час виконання, а не базові можливості моделі. Важлива й ціна: 0,04 долара за задачу ARC-AGI-2 робить сильний результат доступним для звичайних експериментів.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.