Назад
Дослідники з безпеки незадоволені обмеженнями в новій моделі Anthropic Fable
SiTech AI Team2 წთ. საკითხავი

Дослідники з безпеки незадоволені обмеженнями в новій моделі Anthropic Fable

Нова модель Anthropic Fable блокує запити, які лише побічно стосуються кібербезпеки. Дослідники кажуть, що фільтри ловлять звичайну інженерну роботу й відкидають їх до старішої моделі.

Anthropic випустила Fable у вівторок, представивши її як публічну та обмежену версію Mythos — своєї моделі для кібербезпеки. Обмеження, які з нею постачаються, викликали скарги дослідників і фахівців із безпеки: за їхніми словами, фільтри спрацьовують на роботі, яка не має жодного стосунку до атак на системи.

Фільтри реагують на тему, а не на запит

Валентина «Чомпі» Пальміотті, дослідниця з IBM X-Force, написала, що Fable «відхиляє будь-який запит, який хоч побічно стосується кібертематики. Навіть такі невинні завдання, як читання допису в блозі». Коли запит зачіпає захисні механізми, модель зупиняє чат і повідомляє користувачеві, що «заходи безпеки позначили це повідомлення як таке, що стосується кібербезпеки або біології». Ще один дослідник зазначив у X, що навіть прохання переглянути код активує фільтри.

Навіщо ці обмеження

Anthropic запровадила їх, щоб зменшити ризик використання Fable для написання шкідливого коду чи компрометації програмного забезпечення — давня турбота компанії. Обмеження з біології походять із подібного занепокоєння щодо біологічної зброї. Модель також запрограмована переходити на Claude Opus 4.8, коли спрацьовує захист. Окремо Anthropic веде програму Cyber Verification Program: схвалені фахівці з безпеки отримують менше обмежень у роботі з Claude. В OpenAI є схожа програма Trusted Access for Cyber.

Mythos і Project Glasswing

Коли Anthropic випустила Mythos у квітні, доступ до моделі отримала обмежена кількість компаній та організацій у межах ініціативи Project Glasswing, мета якої — захистити критичне програмне забезпечення та інфраструктуру. Минулого тижня компанія розширила доступ до Mythos на сотні організацій у 15 країнах.

Збіг за ключовими словами, а не судження

Метт Суїш, ветеран кібербезпеки, який тепер працює в AI-стартапі Tolmo, сказав TechCrunch: «Якщо попросити її написати безпечний код, вона вважає це роботою з кібербезпеки, а не найкращими практиками програмної інженерії, і вас знижують». На його думку, тригери працюють на ключових словах, тож будь-що з лексичного поля кібербезпеки їх активує. Він додав, що на цьому етапі це зрозуміло і що обмеження, ймовірно, пом'якшать із часом: «Під час такого релізу краще зачепити більше людей, ніж замало, а обмеження згодом послабити». Anthropic не відповіла одразу на запит про коментар.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.