Чому я досі скептичний до LLM після результату Нав'є–Стокса
Обговорюваний допис у блозі доводить, що гучні результати ШІ не означають справжньої автономії: моделям усе ще потрібен ретельний нагляд, а вартість строгих специфікацій, які це виправили б, є структурним бар'єром для більшості фірм.
Проти хайпу
Допис, опублікований 15 вересня в блозі dank.systems, твердить, що ажіотаж навколо великих мовних моделей випередив те, що ці системи насправді здатні робити. Автор пише, що оцінка передових лабораторій будується на наративі, нібито вони от-от створять «повністю автоматизовану заміну більшості працівників розумової праці», тоді як сучасним моделям усе ще потрібен «клопіткий нагляд і запобіжники навіть у найпростіших завданнях».
Гучні демонстрації — робота щодо Нав'є–Стокса, знахідки віддаленого виконання коду у FreeBSD та інцидент із Hugging Face — на його думку, не доводять, що справжню автономію досягнуто. Як доказ він наводить програмні компанії, які й далі наймають інженерів, що на нинішніх бенчмарках отримали б гірші оцінки, ніж моделі, які їх контролюють.
Вузьке узагальнення та ціна специфікацій
Друге твердження стосується узагальнення: моделі добре працюють лише в невеликому околі тих завдань, на яких їх навчали, і навіть там «невелике відхилення в межах освоєного класу завдань призводить до цілковитого провалу або зламу винагороди». Щоб це виправити, потрібна строга специфікація від експертів предметної галузі, а їхній час дорогий — і сама специфікація є окремою навичкою, тож, за його словами, перетин між людьми, які знають галузь, і тими, хто вміє описати її точно, дуже малий.
Витрати праці можуть перевищувати вартість прямої реалізації неформального опису. В апаратній інженерії типовий проєкт процесора має приблизно втричі більше інженерів зі специфікацій і валідації, ніж інженерів-проєктувальників, а співвідношення 5:1 не є чимось нечуваним, зазначає автор.
Математика як найкращий випадок, людська перевірка як запасний варіант
Математичні результати, за словами автора, — «абсолютно найкращий сценарій» для роботи зі строгою специфікацією: саме формулювання теореми вже є специфікацією, його десятиліттями перевіряла математична спільнота, а формалізація в Lean — це переклад добре перевірених об'єктів із mathlib. Попри це, помилки коректності вже дозволяли LLM протягувати хибні доведення крізь ядро Lean.
Альтернатива — людська перевірка — не масштабується під обсяги, які видають моделі, і сама вразлива до маніпуляцій; автор наводить приклади бекдору в xz і «комітів-лицемірів» у ядрі Linux. Якщо людська перевірка залишається в циклі, темп виробництва обмежується людською увагою.
Які фірми можуть дозволити автономний ШІ
Висновок допису: у більшості галузей LLM схожі на «зламаного стажера: швидкого й ефективного в руках дорослого, але якому не дають керувати всім». Лише три класи компаній можуть прийняти повністю автономне використання: ті, хто дешево переносить невдачі (наприклад, команди швидкого прототипування); ті, хто має вузький набір добре захищених завдань (контрольована повторювана робота, чат-підтримка клієнтів); і ті, хто вже платить за строгі специфікації та валідацію (проєктування чипів, розробка ліків).
Перші дві групи чутливі до ціни, і, на думку автора, їм можуть бути достатні відкриті моделі на дешевому обладнанні. Його висновок — наслідки сягнуть далеко за межі передових лабораторій.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.