Назад
Anthropic: GLM-5.3 може самостійно створити інструмент для кібератаки
SiTech AI Team2 წთ. საკითხავი

Anthropic: GLM-5.3 може самостійно створити інструмент для кібератаки

Згідно зі звітом Frontier Red Team від Anthropic, відкрита модель Zhipu AI GLM-5.3 самостійно створює повний інструмент для кібератаки, але випущена зі слабким захистом. У тестах обхід її обмежень вдавався у 64–100% випадків.

Frontier Red Team від Anthropic опублікувала звіт про кіберможливості нової моделі Zhipu AI (за межами Китаю — Z.ai) GLM-5.3. Дослідження показує, що модель здатна самостійно створювати доведений до кінця інструмент кібератаки так само, як Claude Mythos Preview, але вона вийшла без важливих захисних механізмів. Mythos Preview п’ять місяців тому вийшов лише в межах Project Glasswing, з обмеженим доступом.

Що вміє GLM-5.3

На бенчмарку ExploitBench GLM-5.3 створив повний експлойт у 50 із 410 спроб, Claude Mythos Preview — у 56. На внутрішньому бенчмарку Binary Exploitation GLM-5.3 перехопив контроль потоку в 4% випадків, Mythos Preview — у 6%. Ранніші моделі, наприклад Claude Opus 4.6 і GLM-5.2, не змогли цього в жодному випадку.

У тесті із залученням людини дослідник запустив GLM-5.3 на ізольованій системі. За один день вона знайшла кілька невідомих уразливостей у JavaScript-рушії браузера та перетворила їх на робочі експлойти. У другій сесії GLM-5.3-Flash створив експлойт для відомої вразливості Google Chrome (CVE-2026-11645), обійшовши захист pointer-authentication (PAC) на ARM64. На це знадобилося 20 хвилин уваги людини та 8 годин роботи моделі.

GLM-5.3-ის შესაძლებლობებისა და დაცვის გვერდის ავლის დიაგრამა

Захисні механізми легко обходяться

GLM-5.3 має вбудований захист і явно відмовляється від явно шкідливих запитів, але в тестах Anthropic його легко обійшли. Найефективнішою є «аблітерація», стандартна техніка зменшення відмов; оскільки модель має відкриті ваги, відмови можна прибрати майже без зміни можливостей. Команда Anthropic витратила на це приблизно 2 200 GPU-годин і 4 400 доларів. Показник відмов упав із понад 90% до 3% (JailbreakBench), 2% (HarmBench) і 12% (StrongREJECT).

Обхід можливий і без аблітерації: за допомогою оманливої інструкції, ніби модель є незалежним red-team агентом, GLM-5.3 погоджується на шкідливий запит у 64% випадків, із попереднім заповненням токенів мислення — у 92%, з аблітерованою версією — у 100%. Для захищених моделей Claude ці прийоми не працюють (0%).

Що це означає

Центр стандартів та інновацій ШІ NIST (CAISI) 17 вересня визнав GLM-5.3 «найбільш кіберздатною моделлю з відкритими вагами» та зазначив, що вона відстає від американського frontier приблизно на чотири місяці.

За словами Anthropic, GLM-5.3 дасть зловмисникам змогу використовувати кіберуразливості без обмежень, а ті самі можливості допомагають захисникам. Компанія вважає, що захисники повинні мати моделі принаймні того самого рівня, що й супротивники, і закликає уряди незалежно перевіряти потужні моделі.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.