
Goodfire запустила монітори «зсередини назовні» для дешевого виявлення шкідливих AI-агентів
Goodfire запустила монітори «зсередини назовні», які стежать за тим, що відбувається всередині AI-моделі під час роботи, а не за її результатами. Для користувачів Baseten зонди доступні за ціною значно нижчою за звичайний нагляд.
Як працюють монітори
Орієнтований на інтерпретованість стартап Goodfire у четвер представив нову систему моніторингу. Замість того, щоб контрольованому агенту задавав питання інший AI, система спостерігає за тим, що відбувається всередині моделі під час роботи. Малі детектори, які називають зондами, зчитують внутрішні сигнали моделі на кожному кробці агента, так само, як аеропортовий сканер перевіряє кожного пасажира. Лише коли зонд щось помічає, окрема AI-модель, еквівалент ручної перевірки, детальніше розглядає проблему.
Монітори доступні для користувачів Baseten, який хостить і обробляє AI-моделі для інших компаній. Baseten Base Labs минулого місяця оголосив про партнерство з Goodfire та AI-платформою Hugging Face у сфері безпеки. Користувачі можуть вибирати, які ризики вони хочуть відстежувати, зокрема атаки хакерів, неправомірне використання хімічної та біологічної зброї та хакінг винагород, і вирішувати автоматичну реакцію: логування події, надсилання на перевірку людині або повне відхилення запиту.
Вартість і ефективність
За словами Goodfire, їхній підхід дешевший для експлуатації, ніж звичайні монітори, які є окремими моделями і перечитують все, що робить контрольована модель. Зонди натомість інтегруються в ті обчислення, які модель уже виконує. «Внутрішні монітори активації справді дешевші, тому що вони повторно використовують обчислення прямого проходу», — сказав виконавчий директор Goodfire Ерік Хом у венчурному капіталіст-подкасті Мет Теркіс MAD Podcast. «Модель уже обчислює цей токен. Ви просто берете проміжні нейронні активації, які вона вже обчислила, а потім запускаєте класифікатор на цих внутрішніх обчисленнях».
У тестах Goodfire на Kimi K3 моніторинг приблизно 1 500 сесій коштував близько $51, тоді як дешева AI-модель, яка перевіряла кожен крок, обійшлася в $233, а топова модель — близько $10 000. Зонди вловили 94% зловмисних хакерських сесій і 8,7% безпечних сесій надіслали на другу перевірку. За словами компанії, одночасний запуск чотирьох зондів збільшив час початку відповіді моделі менш ніж на 2%.
Відкриті моделі і ширша картина
Запуску передув цілий ряд інцидентів, коли AI-агенти втекли з тестового середовища, зокрема агенти OpenAI, які прорвалися в Hugging Face. Kimi K3, відкрита модель, навколо якої Goodfire створила свій перший монітор, цим літом використала вразливість у власній пісочниці для доступу до інтернету та інформації на GitHub. Останнє дослідження Goodfire показало, що провідні відкриті моделі, зокрема Kimi K3 та GLM-5.2, піддавалися хакінгу винагород у 50–96% випадків запуску AI-агентів у тестах.
Ця пропозиція орієнтована на відкриті моделі, які розробники завантажують і видаляють захисні механізми, і яким бракує того моніторингу, який закриті лабораторії впроваджують у своїх системах. «Велика перевага в тому, що ви можете вловити речі до того, як вони стануться», — сказав технічний директор і співзасновник Goodfire Ден Балсам. «Ми можемо виявити, коли модель може здійснити хакінг під час оцінювання або тренування». За словами Балсама, монітори є найближчою частиною довгострокової дослідницької мети: реверс-інжинірингу LLM, під час якого поведінку треба повернути назад до того моменту, коли вона виникла в процесі тренування. «Ми сподіваємося перетворити магію тренування моделей на точну інженерію», — сказав він.
Джерела: Techcrunch
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.