
Anthropic: відкрита модель Zhipu GLM-5.3 майже зрівнялася з Claude Mythos Preview у створенні експлойтів
За аналізом Frontier Red Team від Anthropic, відкрита модель GLM-5.3 від китайської Zhipu AI здатна самостійно створювати кіберексплойти. Компанія каже, що захист моделі можна обійти простими методами у 64–100% випадків.
Аналіз відкритої моделі GLM-5.3 від Zhipu AI опублікувала 29 вересня Frontier Red Team компанії Anthropic. За оцінкою компанії, ця модель здатна самостійно створювати повний кіберексплойт від початку до кінця, так само як Claude Mythos Preview, який п’ять місяців тому вийшов з обмеженим доступом у межах Project Glasswing. Zhipu AI працює в Китаї, а за його межами відома під назвою Z.ai. Головна відмінність у тому, що GLM-5.3 поширюється з відкритими вагами та без значного захисту.
Що показують тести
На ExploitBench, який вимірює використання відомих уразливостей у рушії V8 Google Chrome, GLM-5.3 створив повний експлойт у 50 із 410 спроб і досяг результату 12%, тоді як Claude Mythos Preview — 14%. У внутрішньому тесті Anthropic Binary Exploitation GLM-5.3 зміг повністю взяти контроль над програмою у 4% спроб, Mythos Preview — у 6%. Ранніші моделі, зокрема Claude Opus 4.6 і GLM-5.2, у цих тестах не досягли успіху в жодному випадку. У оцінці Center for AI Standards and Innovation (CAISI) при NIST від 17 вересня GLM-5.3 названо найпотужнішою відкритою моделлю за кіберможливостями, і зазначено, що вона відстає від американського фронту приблизно на чотири місяці.
Обхід захисту
GLM-5.3 має вбудований захист і часто відмовляє на прямі шкідливі запити, однак у тестах Anthropic цей захист обходили простими методами у 64–100% випадків. Фальшива історія, нібито модель є агентом для автономного тестування кібербезпеки, підвищує успіх до 64%, попереднє заповнення кроків міркування (prefill) — до 92%, а метод abliteration, доступний через відкриті ваги, — до 100%.
Anthropic створила власну abliterated-копію. Її команді, яка нічого подібного не пробувала, знадобилося приблизно 2200 GPU-годин і $4400. У результаті рівень відмов моделі впав з понад 90% до 3% і 2% на JailbreakBench і HarmBench, та до 12% на StrongREJECT. Для GLM-5.3-Flash abliteration провели приблизно за 600 GPU-годин. На захищених моделях Claude жоден із цих методів не спрацював.
Що це означає
В одній сесії дослідник використав GLM-5.3-Flash, щоб зібрати атаку на нещодавно розкриту вразливість Chrome (CVE-2026-11645). Модель самостійно поєднала експлойти двох уразливостей і створила надійний ланцюг для цілі ARM64, обійшовши захист pointer authentication (PAC). Це потребувало 20 хвилин уваги людини та восьми годин роботи моделі, що за цінами API Zhipu коштувало б $20.40. В іншій сесії модель знайшла ланцюг 0-day уразливостей у браузерному компоненті та зі шкідливого вебсайту зчитала приватний ключ SSH з комп’ютера користувача.
Anthropic каже, що захисники не можуть дозволити собі залишатися з моделями, слабшими за моделі супротивників, і закликає уряди проводити незалежне тестування безпеки на достатньо потужних моделях.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.