Назад
Anthropic може перенаправляти запити Claude Sonnet 5.5 на Sonnet 5 через кіберзахист
SiTech AI Team3 წთ. საკითხავი

Anthropic може перенаправляти запити Claude Sonnet 5.5 на Sonnet 5 через кіберзахист

За словами Anthropic, Claude Sonnet 5.5 стала першою моделлю Sonnet із триетапними кіберкласифікаторами та переходом на резервну модель. Заблоковані кіберзапити переходять на Sonnet 5, і це змінює правила для розробників, які працюють через API.

Маршрутизація дійшла до дешевого рівня

Anthropic цього тижня випустила Claude Sonnet 5.5. Це перша модель Sonnet, яка отримала триетапні кіберкласифікатори та перехід на резервну модель, розроблені для найпотужніших систем компанії. Так маршрутизація на основі класифікаторів потрапила на той рівень, де багато команд запускають продуктивні навантаження.

За словами Anthropic, Sonnet 5.5 не просуває межу можливостей моделей компанії, але за навичками в кібербезпеці зіставна з Opus 5. На Terminal-Bench 4.0 Sonnet 5.5 набирає 70,6% проти 66,4% в Opus 5.5. З вимкненими кіберфільтрами вона досягла повного довільного виконання коду у 178 із 410 запусків ExploitBench і виконала 46,1% завдань CyScenarioBench від Irregular проти 0,7% у Sonnet 5.

Триетапна перевірка

Фільтрація працює у три етапи: probe зчитує внутрішні активації моделі, далі працює легкий класифікатор на самій Sonnet 5.5, а окремий навчений LLM-класифікатор зважає на висновок probe і вирішує, чи блокувати розмову. Anthropic каже, що класифікатори виявляють шкідливі кіберзапити на рівні Opus 5, але компанія обрала менш агресивний захист від джейлбрейків, бо Sonnet 5.5 слабша в кібербезпеці за Opus 5 і Fable 5.1. Користувачам варто очікувати більше відмов, ніж із Sonnet 5, зокрема й на законній роботі з кібербезпеки.

Заблоковані кіберзапити та вузький набір запитів, пов'язаних із розробкою фронтирних LLM, наприклад робота з ядром на певних ML-прискорювачах, переходять на Sonnet 5. Блокування з біології, звичайної зброї та антидистиляції зупиняють запит без резервної моделі, і Anthropic каже, що вони ніколи потай не змінюють відповіді.

Перехід на API вмикається вручну

Власні застосунки Anthropic надсилають заблоковані кіберзапити до Sonnet 5 автоматично, але розробники API мають увімкнути це самі, і інші платформи можуть обробляти такі запити інакше. Без увімкненого переходу заблокований запит просто зупиняється, тож перехід із Sonnet 5 на Sonnet 5.5 не є простою заміною моделі. Кіберполітика й далі дозволяє пошук уразливостей у вихідному коді, зберігаючи процеси безпечного кодування, але блокує його у скомпільованих бінарниках. Документація підтримки каже, що перевірки охоплюють усе, що читає модель: пам'ять, вміст конекторів, результати вебпошуку та файли.

Резервна модель і промпт-ін'єкції

У тестах середовищ кодування 25% запитів, надісланих до Sonnet 5.5, обробила Sonnet 5 після спрацювання кіберблоку, часто тому що впроваджені інструкції стерти диски чи видалити файли активували класифікатор. Із цих перенаправлених запитів 12,01% було скомпрометовано, тоді як сама Sonnet 5.5 зазнала зламу лише в чотирьох із 5901 запиту, які обробила.

Anthropic каже, що досі налаштовує класифікатори Sonnet 5.5, щоб зменшити хибні спрацювання, і планує дати перевіреним захисникам менше обмежень у розширеній Cyber Verification Program. На старті Sonnet 5.5 до цієї програми не входить.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.