LLM мають фундаментальну ваду безпеки — і вона, можливо, невиправна
Дослідження, представлене на ICML 2026, виявило, що великі мовні моделі мають фундаментальний дефект у відстеженні ролей. Chain-of-Thought Forgery ламає всі моделі
LLM мають фундаментальну ваду безпеки — і вона, можливо, невиправна
Дослідження, представлене на конференції ICML 2026, виявило фундаментальну проблему безпеки у великих мовних моделях (LLM): вони ідентифікують текстові ролі не за тегами <user> або <system>, а за стилем тексту. Це означає, що заміна тегів жодним чином не впливає на те, як модель інтерпретує текст.
Chain-of-Thought Forgery — нова атака
Дослідники розробили атаку під назвою Chain-of-Thought Forgery (підробка ланцюжка думок), яка імітує власний стиль мислення моделі. За допомогою цієї атаки вдалося обманом змусити GPT-5 надати інструкції з виготовлення кокаїну, просто підробивши внутрішній ланцюжок думок моделі.
Які моделі вразливі
Проблема торкнулася моделей від OpenAI, Anthropic, Alibaba та DeepSeek. Навіть GPT-5.4 надав інструкції щодо самогубства при застосуванні цієї атаки. Дослідження виграло змагання з red-teaming від OpenAI у серпні 2025 року.
Нерозв'язна проблема
Дослідники дійшли висновку, що ця проблема є фундаментально нерозв'язною в поточній архітектурі LLM. Оскільки моделі навчаються на тексті та узагальнюють патерни стилю, а не слідують жорстким тегам, будь-яка система, що покладається на розмежування ролей (наприклад, системні підказки проти користувацького вводу), потенційно вразлива.
Наслідки
Це відкриття має серйозні наслідки для критичних систем, які розгортають LLM: модерація контенту, юридичні консультації, медичні рекомендації, фінансові операції та будь-які сценарії, де важливе розмежування авторитетних джерел і користувацького вводу.