Назад
SiTech Team⏱️ 1 წთ. საკითხავი

Метод GRAM від Anthropic: 'Вимикач' для знань подвійного призначення в AI-моделях

Метод GRAM від Anthropic: 'Вимикач' для знань подвійного призначення в AI-моделях

Anthropic та AE Studio представили GRAM (Gradient-Routed Auxiliary Modules) — революційний метод, який дозволяє AI-моделям хірургічно вмикати/вимикати небезпечні знання (вірусологія, кібербезпека, ядерна фізика) в межах однієї моделі.

Вступ: Проблема знань подвійного призначення

З розвитком штучного інтелекту одним із найбільших викликів для AI-компаній стало те, як керувати знаннями, які накопичують їхні моделі. Фронтирні AI-моделі, такі як Claude від Anthropic, є величезними сховищами інформації. Значна частина цих знань має подвійне призначення.

Чому поточні підходи недостатні?

Сьогодні AI-компанії покладаються переважно на два захисні механізми: навчання моделей відмовляти у шкідливих запитах і розгортання класифікаторів, які перевіряють входи та виходи на небезпечний вміст.

Що таке GRAM?

GRAM (Gradient-Routed Auxiliary Modules) — метод, розроблений Anthropic у співпраці з AE Studio. Ідея елегантно проста: надати моделі виділені, знімні відсіки для кожної категорії знань подвійного призначення.

Експериментальні результати

Anthropic протестував GRAM у трьох сценаріях зростаючої реалістичності. На семи розмірах моделей від 50 мільйонів до 5 мільярдів параметрів GRAM відповідала продуктивності фільтрації даних.

Висновок

Метод GRAM від Anthropic є значним кроком вперед у дослідженні безпеки AI, забезпечуючи 'вимикач' для небезпечних знань.