
Ефект LLMentalist: як чат-боти відтворюють трюк екстрасенса
Есей "The LLMentalist Effect" доводить, що чат-боти переконують не міркуванням, а тим самим трюком, що й холодне читання екстрасенсів: статистично загальними твердженнями, які здаються особистими.
В есеї, опублікованому на softwarecrisis.dev, розробник і автор Балдур Б'ярнасон твердить, що відчуття інтелекту, яке справляють чат-моделі великих мовних моделей (LLM), походить від того самого психологічного механізму, що лежить в основі «холодного читання» екстрасенсів, — суб'єктивної валідації.
Трюк екстрасенса у шість кроків
LLM, за його словами, — це математична модель мовних токенів: ви даєте машині текст і отримуєте математично правдоподібне продовження. Це не пояснює відчуття розмови з розумом, тому Б'ярнасон шукає ілюзію в користувачі, а не в моделі. Він розкладає виступ екстрасенса на шість етапів — публіка, що сама себе відбирає, підготовлена сцена, пошук «клієнта», його перевірка, петля суб'єктивної валідації та фінальне «вау» — і зіставляє кожен із використанням чат-ботів. Скептики щодо ШІ рідко користуються чат-ботами; галас і застереження про «ранні дні» формують очікування; промпт задає контекст; а в розмові затримуються саме ті, хто готові вірити.
Статистично загальне, але переконливе
Холодне читання використовує особливість психіки: твердження, що має особисте значення, сприймається як точне, навіть якщо пасує майже всім. Екстрасенси вживають «валідаційні твердження» — фрази Форера (Барнума) на кшталт «ви часто буваєте до себе надто суворими», «зникаюче заперечення», «веселковий прийом», демографічні та статистичні здогади. Б'ярнасон доводить, що відповіді чат-бота працюють так само: вони звучать ніби під вашу ситуацію, але є статистично ймовірним продовженням промпту, і саме користувач підтверджує, що це «про нього».
RLHF і «механічний менталіст»
Окремо есей зупиняється на RLHF — навчанні з підкріпленням на основі відгуків людей, яким компанії перетворюють сиру модель на чат-продукт. Оцінювачі — зазвичай низькооплачувані працівники без часу на перевірку фактів, а модель винагороди сама є мовною моделлю, тож відгуки не можуть винагороджувати факти — лише тон і структуру тексту, оціненого як точний. Висновок автора: RLHF фактично став системою винагород за «валідаційні твердження» — «механічним менталістом». Він вважає ефект випадковим, а не навмисним обманом, і порівнює індустрію з екстрасенсами, які холодно читають несвідомо. Він радить не вбудовувати LLM у продукти й процеси, посилаючись на галюцинації, ненадійні підсумки та проблеми безпеки, і пропонує ставитися до переконливого чат-бота як до переконливого сеансу — з цікавістю до трюку, а не вірою в силу.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.