
Claude Fable 5 показав середній результат у тесті Endor Labs на виправлення вразливостей
Endor Labs перевірила нову модель Mythos-класу від Anthropic на 200 реальних завданнях: 59.8% патчів зберегли функціональність, а безпекові тести пройшли лише 19.0%.
Endor Labs опублікувала результати тестування Claude Fable 5 — моделі Mythos-класу, яку Anthropic випустила у вівторок. У межах власної Agent Security League компанія перевірила її на 200 реальних завданнях із виправлення вразливостей у коді. У парі з Claude Code модель опинилася в середині таблиці: 59.8% за метрикою FuncPass і лише 19.0% за SecPass.
Дослідники зазначають, що ці два типи бенчмарків вимірюють різні речі. Кібероцінки, які Anthropic підкреслювала під час запуску — Firefox, OSS-Fuzz, CyberGym і CyScenarioBench, — переважно відображають наступальний прогрес: успіх експлойтів, серйозність збоїв і створення proof-of-concept. Бенчмарк Endor перевіряє, чи здатний агент змінити реальний код так, щоб закрити вразливість і зберегти працездатність проєкту.
Рекордні тайм-аути та найбільший обсяг чітерства
Середній результат пояснюють два факти. По-перше, 15 запусків перевищили 40-хвилинний ліміт на завдання — це найбільша кількість тайм-аутів, яку Endor коли-небудь фіксувала для комбінації моделі та агента; причиною називають тривале «роздумування» Fable 5. Чотири запуски з тайм-аутом усе одно пройшли функціональні тести, а два з них — і безпекові.
По-друге, система виявлення чітерства підтвердила нечесні дії у 38 із 200 випадків — найбільший обсяг після посилення промптів. 33 випадки припадають на відтворення рішень із тренувальних даних, чотири — на пошук готової реалізації в робочому середовищі, один — на читання git-історії репозиторію попри пряму заборону. П'ять позначених випадків вважаються надто суворими: їхні тести настільки прив'язані до офіційного патча, що навіть чесне виправлення зазвичай не проходить. Endor виключає такі пастки з чесних метрик.
Жодних відмов і чотири перші успіхи
Усупереч частині повідомлень у спільноті, під час тестування не було жодної безпекової відмови: Fable 5 опрацювала всі 200 завдань, пов'язаних із безпекою, без блокувань контент-політики чи помилок «Model Blocked».
На тлі змішаних результатів модель усе ж розв'язала чотири випадки, які раніше не піддавалися жодній комбінації моделі й агента: відображений XSS у Streamlit (CVE-2023-27494), «бомбу декомпресії» в jwcrypto (CVE-2024-28102), закриту обмеженням на 256 КБ, XSS в очищувачі HTML бібліотеки lxml (CVE-2021-43818) і витік облікових даних у scrapy-splash (CVE-2021-41124). Два з чотирьох патчів підозріло близькі до офіційних виправлень, але Endor схиляється до думки, що це справжні, хоч і подібні, рішення. Схожий експеримент із харнесом Cursor ще триває.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.