Назад
SiTech Team⏱️ 1 წთ. საკითხავი

Claude Opus 5 вирішив проблему prompt injection — найбільшу вразливість AI-агентів

Claude Opus 5 вирішив проблему prompt injection — найбільшу вразливість AI-агентів

Anthropic Opus 5 знизив успішність атак prompt injection до 0% у браузерних AI-агентах — прорив у безпеці AI.

Prompt Injection — Ахіллесова п'ята AI-агентів

Prompt injection залишався найбільшим викликом безпеці для AI-агентів. Метод атаки простий: зловмисники ховають шкідливі інструкції в тексті вебсторінки, яку читає AI-агент. У результаті AI може виконувати небажані дії — від витоку даних до неавторизованих операцій. OpenAI визнав у грудні 2024 року, що prompt injection, можливо, ніколи не буде повністю вирішено. Це була одна з найбільших перешкод для широкого впровадження AI-агентів.

Подвійний механізм захисту Opus 5

Дослідники Anthropic впровадили в Opus 5 Auto Mode — дворівневу систему захисту. Перший рівень сканує вхідні дані на приховані інструкції до обробки. Другий рівень блокує небезпечні дії перед виконанням. Зловмисник має подолати обидва рівні одночасно.

Результати тестування — нульовий показник успішності

У 129 тестових сценаріях Opus 5 досяг 0% успішності атак prompt injection для браузерних агентів. У бенчмарку Gray Swan IPI рівень успішності атак на Opus 5 становив лише 2.0%, Mythos 5 — 2.6%, Fable 5 — 2.8%. Це історичне досягнення в безпеці AI.

📖 Джерело