← უკან დაბრუნება
SiTech Team⏱️ 1 წთ. საკითხავი

Anthropic-ის GRAM მეთოდი: 'გამორთვის ღილაკი' ორმაგი დანიშნულების ცოდნისთვის AI მოდელებში

Anthropic-ის GRAM მეთოდი: 'გამორთვის ღილაკი' ორმაგი დანიშნულების ცოდნისთვის AI მოდელებში

Anthropic-მა და AE Studio-მ წარმოადგინეს GRAM (Gradient-Routed Auxiliary Modules) — რევოლუციური მეთოდი, რომელიც AI მოდელებს საშუალებას აძლევს ქირურგიული სიზუსტით ჩართონ/გამორთონ საშიში ცოდნა (ვირუსოლოგია, კიბერუსაფრთხოება, ბირთვული ფიზიკა) ერთი მოდელის ფარგლებში.

შესავალი: ორმაგი დანიშნულების ცოდნის პრობლემა

ხელოვნური ინტელექტის განვითარებასთან ერთად, ერთ-ერთ ყველაზე დიდ გამოწვევად იქცა ის, თუ როგორ უნდა მართონ AI კომპანიებმა ის ცოდნა, რომელსაც მათი მოდელები აგროვებენ. ფრონტირული AI მოდელები, როგორიცაა Anthropic-ის Claude, უზარმაზარ ცოდნას ინახავენ. ამ ცოდნის ნაწილი ორმაგი დანიშნულებისა (dual-use) — მისი გამოყენება შესაძლებელია როგორც სიკეთისთვის, ასევე ზიანის მიყენებისთვის. ეს არის ერთ-ერთი ყველაზე აქტუალური AI მმართველობის საკითხი.

რატომ არ კმარა მიმდინარე მიდგომები?

დღეს AI კომპანიები ძირითადად ორ დამცავ მექანიზმს იყენებენ: მოდელების წვრთნას, რომ უარი თქვან მავნე მოთხოვნებზე, და კლასიფიკატორებს, რომლებიც შეყვანილ და გამომავალ მონაცემებს ამოწმებენ. მათი ფუნდამენტური შეზღუდვა ისაა, რომ ისინი არ ცვლიან მოდელის შიგნით შენახულ ცოდნას.

რა არის GRAM?

Anthropic-მა AE Studio-სთან თანამშრომლობით შეიმუშავა GRAM (Gradient-Routed Auxiliary Modules). იდეა ელეგანტურად მარტივია: მოდელს ეძლევა გამოყოფილი, მოსახსნელი კუპეები ორმაგი დანიშნულების ცოდნის თითოეული კატეგორიისთვის.

ექსპერიმენტები და შედეგები

Anthropic-მა GRAM სამ სხვადასხვა სცენარში გამოსცადა. 50 მილიონიდან 5 მილიარდ პარამეტრამდე მასშტაბებზე, GRAM უტოლდებოდა მონაცემთა ფილტრაციის ეფექტურობას.

რეზისტენტობა ატაკების მიმართ

Atak-ების მიმართ რეზისტენტობის თვალსაზრისით, GRAM-მა ისევე კარგად გაართვა თავი, როგორც მონაცემთა ფილტრაციამ. ტრადიციული 'unlearning' ტექნიკა ადვილად გამტვრევადი აღმოჩნდა.

დასკვნა

Anthropic-ის GRAM მეთოდი AI უსაფრთხოების კვლევაში მნიშვნელოვან ნაბიჯს წარმოადგენს. ის გვთავაზობს 'გამორთვის ღილაკს' საშიში ცოდნისთვის, რაც საშუალებას გვაძლევს გამოვიყენოთ AI-ს სარგებელი რისკების მინიმიზაციისას.