
Великі моделі більше не працюють: GPT-5.5 галюцинує у 86% випадків, GLM-5.2 — у 28%
Аналіз на arrowtsx.dev показує, що гонка за параметрами вичерпала себе: відкрита модель GLM-5.2 під ліцензією MIT майже наздогнала GPT-5.5 у бенчмарках і значно перевершує її за правдивістю відповідей.
Дедалі більше провідних лабораторій штучного інтелекту ставлять під сумнів припущення, що нескінченне зростання кількості параметрів і навчальних даних автоматично дає кращі моделі. В аналізі, опублікованому на arrowtsx.dev 18 червня, автор доводить, що масштабування вичерпало себе, а розмір тепер пов'язаний з іншою проблемою — моделями, які не визнають власної невпевненості.
Бенчмарки й гонка параметрів
Текст починається з незвичного прикладу. Доступ до Claude Fable 5 обмежив уряд США через три дні після випуску — це, за словами автора, перша американська заборона ШІ, зумовлена національною безпекою, причиною якої став ризик одного джейлбрейку. Тим часом відкрита модель Z.ai GLM-5.2 (753 млрд параметрів, близько 40 млрд активних) відстає від GPT-5.5 лише на 4 пункти, а від Fable 5 — на 9 пунктів в Artificial Analysis Intelligence Index. Opus 4.8 і GPT-5.5 — закриті моделі, які консервативно оцінюють у 1–2 трлн параметрів. Якщо відкрита модель під ліцензією MIT так наблизилася до закритої, у півтора-два рази більшої, робить висновок автор, зростання інтелекту практично зупинилося.
Рівень галюцинацій
Друга частина аналізу присвячена правдивості. У бенчмарку AA-Omniscience DeepSeek V4 Pro (1,6 трлн параметрів, 49 млрд активних) показує 94% галюцинацій: на запитання, відповіді на які не знав, він визнавав це лише приблизно у 6% випадків. GLM-5.2 отримав 28%, Opus 4.8 — 36%, Fable 5 — 48%, GPT-5.5 — 86%. Моделі, навчені на величезних обсягах фактологічних даних, на думку автора, вчаться завжди давати відповідь, а не казати «не знаю».
Тест і нерозв'язана трилема
Щоб це проілюструвати, обом моделям дали складне завдання з Python з очевидною архітектурною вадою — з високим рівнем reasoning effort і температурою 1 через OpenRouter. DeepSeek V4 Pro витратив майже вдесятеро більше токенів міркування і все одно впевнено відповів неправильно. GLM-5.2 знадобилося близько 12 секунд і 800 токенів, щоб усвідомити неможливість однопотокового виконання мультиплексованого I/O без жодної віддачі керування. В окремому запуску DeepSeek V4 Pro витратив 3 хвилини 26 секунд у циклі міркувань, перш ніж видати добре оформлене, але хибне рішення.
Висновок: навчання й вибір моделей мають будуватися навколо нерозв'язаної трилеми — базових можливостей, калібрування невпевненості та обчислювальної ефективності. Вибір моделі лише за розміром чи місцем у лідерборді, попереджає автор, дедалі частіше означає вибір системи, яка переконливо доводитиме неправильну відповідь.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.