Назад
«Моделі дурнішають навмисно»: лабораторії міняють знання на міркування
SiTech AI Team2 წთ. საკითხავი

«Моделі дурнішають навмисно»: лабораторії міняють знання на міркування

Автор блогу твердить, що AI-лабораторії свідомо обмінюють знання про світ на здатність міркувати: моделі кращають у математиці та коді, але гірше згадують факти.

У блозі під назвою «Models Are Getting Dumber on Purpose» автор доводить, що провідні AI-лабораторії свідомо обмінюють знання про світ на здатність міркувати: моделі розв'язують математичні та програмні задачі з меншими витратами обчислень на токен, але гірше пригадують факти.

Бенчмарки, що вказують у різні боки

За даними посту, GLM-5.2 набирає 99,2% на AIME 2026 приблизно з 40 мільярдами активних параметрів на токен, Qwen3.5 — 91,3% з 17 мільярдами, а DeepSeek V4-Flash працює на 13 мільярдах. Для масштабу: у 2023 році GPT-4 приписували близько 280 мільярдів активних параметрів, і він ледве розв'язував задачу AIME. Qwen3.5 9B у квантизованому вигляді вміщається у 6 ГБ відеопам'яті та приблизно вдвічі перевищує результат наступної найкращої моделі до 10 мільярдів параметрів в індексі інтелекту Artificial Analysis. Із запам'ятовуванням фактів картина протилежна: на SimpleQA, де інструменти заборонені, лідер — Gemini 2.5 Pro з 53%, а Qwen3.5 4B і 9B показують рівень галюцинацій 80–82%.

Факти старіють, процедури — ні

Дослідження ємності знань, зокрема серія «Physics of Language Models», оцінюють її приблизно у два біти фактичних знань на параметр. Автор твердить, що міркування стискається краще, бо це невеликий набір процедур, які застосовують повторно: розбити задачу на частини, відстежувати проміжний стан, перевіряти власні кроки, повертатися назад. Phi-4 — модель на 14 мільярдів параметрів, навчена переважно на синтетичних даних у стилі підручника: сильна в математиці й слабка в дрібних фактах. Факти мають термін придатності — API та ціни змінюються, а алгебра ні.

Де тепер живе знання

Якщо моделі більше не зберігають факти, їх подає зовнішнє середовище — пошук, виклики інструментів, документація. Агентові для програмування не потрібно пам'ятати API залежності: він читає node_modules або документацію, тож відповідь ґрунтується на фактично встановленій версії. Автор припускає, що за кілька років міркування рівня frontier працюватиме на одній споживчій відеокарті: DeepSeek V4-Flash уже міркує з 13 мільярдами активних параметрів, а решта 271 мільярд переважно зберігає факти в експертних шарах. Хибний факт, зашитий у ваги, неможливо виправити без донавчання, тоді як помилка в документі має адресу — її виправлення покращує всі наступні запити. Автор припускає, що згодом у картках моделей можуть узагалі перестати вказувати дату відсікання знань.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.