Дослідження: приховані міркування ШІ відновлюють із зашифрованих блоків
Нова праця показує, що зашифровані блоки ланцюжка міркувань, які повертають API Anthropic, OpenAI і Google, можна відтворити у слабшій моделі та отримати приховані міркування фронтирної моделі — не активуючи її засоби захисту.
Що з'ясували дослідники
Згідно з працею дослідників із MATS Research, Інституту ELLIS у Тюбінгені, Інституту інтелектуальних систем Макса Планка, компанії Snyk та інших установ, закриті міркування можна відновити із зашифрованих слідів, які постачальники ШІ повертають клієнтам. Anthropic, OpenAI і Google надсилають зашифровані блоки «ланцюжка міркувань», які можна відтворювати між сесіями, користувачами та моделями.
Метод не атакує найсильнішу модель напряму. Дослідники відтворюють слід, створений фронтирною моделлю, у слабшій моделі-«родичі», зламують її за допомогою джейлбрейку й отримують приховані міркування сильнішої моделі відкритим текстом — не активуючи її захист від дистиляції.
Витяг за два виклики API
В одному з прикладів слід міркувань Claude Opus 4.8 — блок thinking, підпис якого сягає приблизно 36 180 символів — передається Claude Haiku 4.5 разом із вказівкою продовжити й дослівно переписати додане міркування всередині тегів <thinking-copy>. Слабша модель повертає покрокові міркування сильнішої відкритим текстом.
Що знайшли в публічних логах
Автори зібрали 6 708 публічно доступних траєкторій агентів із GitHub і Hugging Face, створених моделями Claude, GPT і Gemini, які досі містили зашифровані блоки міркувань. Застосування конвеєра декодування до кожного підписаного блоку дало 315 320 відновлених блоків міркувань.
Обмежившись справжніми, небенчмарковими сесіями, дослідники виявили 704 різні приватні артефакти: 62 API-ключі, 33 паролі, 24 токени доступу, 30 особистих електронних адрес, а також імена, поштові адреси, внутрішні URL та технічні ідентифікатори. Розподіл такий: 351 технічний ідентифікатор, 204 персональні дані й 126 облікових даних. 64 із 704 артефактів з'являлися лише в блоках міркувань і ніколи — у видимій сесії.
Додаткові експерименти
Праця також описує тест Kimi-K3: попереднє заповнення міркувань моделі лише першим 1% токенів міркувань Opus 4.8 зсунуло її видиму відповідь у бік формулювань сильнішої моделі, хоча саму відповідь не заповнювали. В іншому експерименті модель просили обміркувати шкідливий вміст, залишивши видиму відповідь безпечною, — небезпечні знання залишилися в прихованому сліді, звідки атака витягла їх відкритим текстом. Автори також відзначають неточність підсумків: на деяких задачах AIME Opus 4.8 називає відповідь до її виведення, а підсумок API не завжди зберігає цю різницю, тож міркування виглядає як чистий висновок.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.