Anthropic-in GRAM Metodu: AI Modellərində İkili Təyinatlı Biliklər üçün 'Söndürmə Düyməsi'
Anthropic və AE Studio GRAM (Gradient-Routed Auxiliary Modules) metodunu təqdim etdi — AI modellərinə təhlükəli bilikləri (virusologiya, kibertəhlükəsizlik, nüvə fizikası) bir model daxilində cərrahi dəqiqliklə idarə etməyə imkan verən inqilabi üsul.
Giriş: İkili Təyinatlı Bilik Problemi
Süni intellekt inkişaf etdikcə, AI şirkətlərinin üzləşdiyi ən böyük çətinliklərdən biri modellərinin topladığı bilikləri necə idarə etməkdir. Öndə gedən AI modelləri, Anthropic-in Claude-u kimi, böyük məlumat anbarlarıdır. Bu biliklərin əhəmiyyətli bir hissəsi ikili təyinatlıdır.
Mövcud yanaşmalar niyə kifayət etmir?
Bu gün AI şirkətləri əsasən iki müdafiə mexanizmindən istifadə edirlər: modelləri zərərli sorğuları rədd etmək üçün təlim etmək və təhlükəli məzmun üçün girişləri yoxlayan klassifikatorlar yerləşdirmək.
GRAM nədir?
GRAM-in arxasındakı əsas ideya zərif şəkildə sadədir: modelə ikili təyinatlı biliklərin hər bir kateqoriyası üçün xüsusi, çıxarıla bilən bölmələr təqdim etmək.
Təcrübi nəticələr
Anthropic GRAM-ı üç artan reallıq ssenarisində sınaqdan keçirdi. 50 milyondan 5 milyard parametrə qədər yeddi model ölçüsündə sınaqdan keçirildi.
Nəticə
Anthropic-in GRAM metodu AI təhlükəsizliyi tədqiqatında mühüm irəliləyişdir. GRAM təhlükəli biliklər üçün 'söndürmə düyməsi' təmin edir.