Claude Opus 5 вирішив проблему prompt injection — найбільшу вразливість AI-агентів
Anthropic Opus 5 знизив успішність атак prompt injection до 0% у браузерних AI-агентах — прорив у безпеці AI.
Prompt Injection — Ахіллесова п'ята AI-агентів
Prompt injection залишався найбільшим викликом безпеці для AI-агентів. Метод атаки простий: зловмисники ховають шкідливі інструкції в тексті вебсторінки, яку читає AI-агент. У результаті AI може виконувати небажані дії — від витоку даних до неавторизованих операцій. OpenAI визнав у грудні 2024 року, що prompt injection, можливо, ніколи не буде повністю вирішено. Це була одна з найбільших перешкод для широкого впровадження AI-агентів.
Подвійний механізм захисту Opus 5
Дослідники Anthropic впровадили в Opus 5 Auto Mode — дворівневу систему захисту. Перший рівень сканує вхідні дані на приховані інструкції до обробки. Другий рівень блокує небезпечні дії перед виконанням. Зловмисник має подолати обидва рівні одночасно.
Результати тестування — нульовий показник успішності
У 129 тестових сценаріях Opus 5 досяг 0% успішності атак prompt injection для браузерних агентів. У бенчмарку Gray Swan IPI рівень успішності атак на Opus 5 становив лише 2.0%, Mythos 5 — 2.6%, Fable 5 — 2.8%. Це історичне досягнення в безпеці AI.