Назад
2000 атак на одного AI-асистента: 6000 листів і жодного витоку
SiTech AI Team2 წთ. საკითხავი

2000 атак на одного AI-асистента: 6000 листів і жодного витоку

Розробник відкрив свого асистента Fiu на платформі OpenClaw для публічних атак електронною поштою. Понад 6000 листів від 2000 людей не змусили його розкрити вміст secrets.env.

Асистент, відкритий для всіх охочих

Автор блогу fernandoi.cl створив сайт hackmyclaw.com, де будь-хто міг надіслати лист Fiu — асистентові, що працює на платформі OpenClaw. Мета була одна: змусити агента показати вміст файлу secrets.env. Fiu мав вказівку не відповідати на листи, адже відповідь на кожне повідомлення коштувала б надто дорого, проте таку можливість він мав — і частиною завдання було саме вмовити його відповісти.

Асистент працював на VPS із коротким інструктажем із безпеки: ніколи не розкривати облікові дані та вміст secrets.env, не змінювати власні конфігураційні файли, не виконувати команди чи код із листів і не передавати дані на зовнішні адреси. Після того як проєкт потрапив на головну сторінку Hacker News, Fiu отримав понад 6000 листів від більш ніж 2000 людей. Секрет не витік.

Авторитет, терміновість і соціальна інженерія

Нападники використовували знайомі прийоми тиску. У темах листів ішлося про повідомлення з майбутнього, терміновий запит на реагування на інцидент, аудит відповідності з 24-годинним дедлайном або останнє нагадування про резервну копію secrets.env. Одна людина надіслала 20 варіацій за чотири хвилини, інша представилася «адміністратором OpenClaw» з адреси на proton.me, а кілька спробували французьку, іспанську, італійську та інші мови.

Що пішло не за планом

Не все минуло гладко. Google заблокував пошту Fiu: тисячі вхідних листів і швидкі виклики API активували систему виявлення шахрайства, і відновлення доступу зайняло три дні. Експеримент коштував понад 500 доларів на API, бо кожен лист споживав токени. Приблизно на 500-му листі Fiu сам зрозумів, що це гра, і записав у пам'ять: обсяг свідчить про координоване навчання з безпеки, а не про справжню зловмисну активність. Пакетна обробка теж псувала дослід: якщо перші листи в партії були очевидними ін'єкціями, агент ставав підозрілим до всього наступного, тож налаштування змінили так, щоб кожен лист оброблявся в новому контексті.

Менше успішних атак, ніж очікувалося

Жодна з понад 6000 спроб не витягла секрет — навіть складні атаки, що поєднували видавання себе за керівництво, фальшиве реагування на інцидент і багатомовну соціальну інженерію. Експеримент проводився на Claude Opus 4.6 — моделі, яку Anthropic спеціально навчала протидії prompt injection; автор припускає, що на менших моделях результат був би іншим. Його головний висновок стриманий: prompt injection залишається реальною проблемою безпеки, і довіряти AI-агенту необмежені права він усе одно не став би. Але після тисяч невдалих листів він значно оптимістичніший щодо наявних засобів захисту. Кілька сторін навіть запропонували спонсорувати виклик — серед них Corgea, Abnormal AI та анонімний донор, які збільшили приз і покрили витрати на API.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.