Anthropic-ի GRAM մեթոդը. «Անջատիչ կոճակ» երկակի նշանակության գիտելիքի համար AI մոդելներում
Anthropic-ը և AE Studio-ն ներկայացրեցին GRAM (Gradient-Routed Auxiliary Modules) մեթոդը — հեղափոխական մեթոդ, որը AI մոդելներին թույլ է տալիս վիրաբուժական ճշգրտությամբ միացնել/անջատել վտանգավոր գիտելիքը (վիրուսաբանություն, կիբերանվտանգություն, միջուկային ֆիզիկա) մեկ մոդելի շրջանակներում:
Ներածություն. Երկակի նշանակության գիտելիքի խնդիրը
Արհեստական ինտելեկտի զարգացման հետ մեկտեղ, AI ընկերությունների առջև ծառացած ամենամեծ մարտահրավերներից մեկն այն է, թե ինչպես կառավարել գիտելիքը, որը կուտակում են իրենց մոդելները: Առաջատար AI մոդելները, ինչպիսին է Anthropic-ի Claude-ը, տեղեկատվության հսկայական պահեստներ են: Այս գիտելիքի զգալի մասը երկակի նշանակության է:
Ինչու են ներկա մոտեցումները անբավարար
Այսօր AI ընկերությունները հիմնականում ապավինում են երկու պաշտպանական մեխանիզմի: մոդելների ուսուցում վնասակար հարցումները մերժելու համար (refusal training) և դասակարգիչների տեղակայում:
Ինչ է GRAM-ը:
GRAM-ի հիմքում ընկած գաղափարը նրբագեղորեն պարզ է: մոդելին տրամադրել նվիրված, հեռացվող խցիկներ երկակի նշանակության գիտելիքի յուրաքանչյուր կատեգորիայի համար:
Փորձարարական արդյունքներ
Anthropic-ը GRAM-ը փորձարկեց երեք տարբեր սցենարներում: Յոթ մոդելի չափսերում 50 միլիոնից մինչև 5 միլիարդ պարամետր, GRAM-ը համապատասխանում էր տվյալների զտման արդյունավետությանը:
Եզրակացություն
Anthropic-ի GRAM մեթոդը կարևոր քայլ է AI անվտանգության հետազոտության մեջ՝ ապահովելով 'անջատիչ կոճակ' վտանգավոր գիտելիքի համար: