Назад
Дослідник зламав Auto Mode у Claude Code: успіх до 80%
SiTech AI Team2 წთ. საკითხავი

Дослідник зламав Auto Mode у Claude Code: успіх до 80%

Йоганн Ребергер через шкідливий сайт змусив Claude Code Opus 5 виконувати код атакувальника в Auto Mode з успіхом 60-80%. Anthropic каже: класифікатор — не межа безпеки.

Дослідник безпеки Йоганн Ребергер, автор блогу Embrace The Red, опублікував техніку, яка змушує Claude Code — агента для програмування від Anthropic — виконувати код атакувальника в режимі Auto Mode. Це режим дозволів, який замінив підтвердження людини класифікатором безпеки і з середини серпня 2026 року став типовим у Claude Code.

Як працює ланцюг атаки

Тест починається зі звичайного запиту: підсумувати вебсайт. Сторінка відповідає на перше звернення помилкою HTTP 415, що підштовхує Claude повторити спробу через curl у shell замість інструмента WebFetch. Далі відповідь перенаправляє на ZIP-архів із правдоподібними каталожними записами, закодованими в Base85 і zlib, а також з manifest, README і бінарним декодером. Claude відмовляється запускати наданий бінарник — і натомість пише власний декодер на Python, який виконує в підконтрольній атакувальнику теці. У цій теці лежить файл struct.py, який затіняє однойменний модуль стандартної бібліотеки Python. Коли декодер імпортує base64, отруєний struct.py виконується, завантажує віддалений етап на Python і запускає нативний payload, що зв'язується з сервером керування; видимим доказом відкривається калькулятор.

Рівень успіху та заблоковане очищення

Ребергер повідомляє про успіх від 60% до 80% на невеликих вибірках — по п'ять запусків на варіант. У частині тестів Claude згодом розпізнавав пастку в архіві й намагався зупинити шкідливий процес — але Auto Mode заблокував команду очищення. У другому варіанті отруєний модуль запускає ще один безголовий екземпляр Claude Code через "claude -p", і той виконує розвідку (whoami, uname), відкриває калькулятор і записує файли поза робочою текою.

Суперечка з результатом 0,00%

Замовлене Anthropic оцінювання третьої сторони перевірило 72 сценарії непрямого prompt injection по десять разів кожен і зафіксувало 0,00% успіху атак для Opus 5 в Auto Mode; Борис Черни з команди Claude Code заявив, що багаторівневий захист зводить непрямий prompt injection на невідомих атаках майже до нуля. Ланцюг дослідника не входив до цього фіксованого набору, тож обидва результати можуть бути правдивими одночасно — і саме тому, на його думку, одне число в заголовку вводить в оману.

Anthropic закрила його звіт зі статусом "Informative": Auto Mode — це зручність, підкріплена найкращим із можливих класифікаторів, а не гарантія безпеки, а справжня межа — ізоляція ОС і контроль мережевого виходу. Ребергер погоджується, що класифікатор не є пісочницею, і радить запускати автономних агентів у контейнерах чи віртуальних машинах, обмежувати мережу, стежити за ними й тримати подалі домашні теки, SSH-ключі та хмарні облікові дані.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.