Geri qayıt
SiTech Team⏱️ 1 წთ. საკითხავი

Anthropic-in GRAM Metodu: AI Modellərində İkili Təyinatlı Biliklər üçün 'Söndürmə Düyməsi'

Anthropic-in GRAM Metodu: AI Modellərində İkili Təyinatlı Biliklər üçün 'Söndürmə Düyməsi'

Anthropic və AE Studio GRAM (Gradient-Routed Auxiliary Modules) metodunu təqdim etdi — AI modellərinə təhlükəli bilikləri (virusologiya, kibertəhlükəsizlik, nüvə fizikası) bir model daxilində cərrahi dəqiqliklə idarə etməyə imkan verən inqilabi üsul.

Giriş: İkili Təyinatlı Bilik Problemi

Süni intellekt inkişaf etdikcə, AI şirkətlərinin üzləşdiyi ən böyük çətinliklərdən biri modellərinin topladığı bilikləri necə idarə etməkdir. Öndə gedən AI modelləri, Anthropic-in Claude-u kimi, böyük məlumat anbarlarıdır. Bu biliklərin əhəmiyyətli bir hissəsi ikili təyinatlıdır.

Mövcud yanaşmalar niyə kifayət etmir?

Bu gün AI şirkətləri əsasən iki müdafiə mexanizmindən istifadə edirlər: modelləri zərərli sorğuları rədd etmək üçün təlim etmək və təhlükəli məzmun üçün girişləri yoxlayan klassifikatorlar yerləşdirmək.

GRAM nədir?

GRAM-in arxasındakı əsas ideya zərif şəkildə sadədir: modelə ikili təyinatlı biliklərin hər bir kateqoriyası üçün xüsusi, çıxarıla bilən bölmələr təqdim etmək.

Təcrübi nəticələr

Anthropic GRAM-ı üç artan reallıq ssenarisində sınaqdan keçirdi. 50 milyondan 5 milyard parametrə qədər yeddi model ölçüsündə sınaqdan keçirildi.

Nəticə

Anthropic-in GRAM metodu AI təhlükəsizliyi tədqiqatında mühüm irəliləyişdir. GRAM təhlükəli biliklər üçün 'söndürmə düyməsi' təmin edir.