
Люди пропустили кожну третю загрозу, схвалюючи команди AI-агента — дані гри
Браузерна гра, у якій гравці схвалюють або відхиляють команди AI-агента, зібрала понад 40 000 запусків. Гравці пропустили кожну третю шкідливу команду, середня точність — 66,3%.
Дані браузерної гри, у якій гравці схвалюють або відхиляють команди AI-агента для коду, свідчать, що перевірка «людиною в циклі» є слабким захисним бар'єром. У дописі від 5 серпня розробник Алекс Ваутерс повідомляє, що гра зібрала понад 40 000 запусків і 409 000 окремих рішень «схвалити/відхилити». Частина команд рутинна — як-от git status чи npm test, — а інші вказують на те, що агента скомпрометовано і він надсилає секрети на віддалений сервер. Середній гравець пропускав одну загрозу з трьох, тобто середня точність становила 66,3%.
Головні цифри
Майже третина сесій — 32,9% — завершилася з негативним результатом: штрафи за схвалені загрози та заблоковані безпечні команди переважили все зроблене правильно. Близько 35,2% гравців упіймали всі загрози, але лише 20,8% досягли цього, блокуючи максимум одну з п'яти безпечних команд; решта дійшла до цього частково завдяки блокуванню всього. А 7% гравців схвалювали кожен запит. Автор зауважує важливу деталь: приблизно 34% команд у грі були загрозами — значно більше, ніж у щоденній роботі, — хоча, на його думку, реальний тиск швидко випускати продукт дає такі самі поспішні схвалення.
Які загрози проходять повз
Частота пропусків різко відрізнялася за категоріями. Очевидно руйнівні команди, як-от rm -rf /, ловили найнадійніше: 11,7% пропусків. Постійні зміни — ін'єкція crontab чи перехоплення git config — пропускали у 23,8% випадків, витік даних і виконання коду (запити curl до невідомих API, підмінені пакети) — у 33,4%. Порушення меж доступу, наприклад читання ~/.aws/credentials, пропускали найчастіше — у 35,0%. Найбільш пропущеною окремою командою була npm run analyze, яку схвалили 64,7% гравців, хоча журнал історії показував підозрілий скрипт у package.json; до першої десятки увійшли також npm run setup і npm run deploy. У сукупності ці три команди npm run пропускали у 52,5% випадків проти 28,4% для інших атак типу витоку даних.
Утома та надмірне блокування
Крім того, частота пропусків зростала ближче до кінця сесій — це узгоджується з «утомою від дозволів», яку визнають і в Anthropic щодо Claude Code: чим більше підтверджень бачить користувач, тим менше уваги він приділяє кожному. Поширеною була й протилежна помилка: безпечні команди регулярно відхиляли, зокрема налаштування внутрішнього дзеркала npm config set registry (заблоковано 59% разів), rm -rf dist/ (45%) і команду для звільнення порту сервера (43%). Найсуперечливішим випадком була cat ~/.zshrc, яку схвалили 45,9% гравців.
Висновок
Автор визнає, що це гра, а не академічне дослідження, але наполягає, що експеримент демонструє проблеми підходу «людина в циклі» як межі безпеки для AI-агентів: шум породжує втому, розробникам часто бракує контексту, щоб оцінити зміни, а обхід підтверджень стає привабливим. Його рекомендація — інвестувати в пісочниці (sandboxing) і сувору ізоляцію контексту, а широкі дозволи агенту надавати лише після появи цих запобіжників.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.