
OpenAI-მა მოწინავე RL-სწავლებისთვის „safety case“-ის ჩარჩო წარადგინა
OpenAI-მა 28 სექტემბერს გაიდლაინი გამოაქვეყნა: ფრონტიერი მოდელების RL-სწავლება მტკიცებულებებზე დაფუძნებულ safety case-ს მოითხოვს. ჩარჩო გასწორებას, იზოლაციას, მონიტორინგსა და მართვას მოიცავს.
OpenAI-მა 28 სექტემბერს გაიდლაინი გამოაქვეყნა: ფრონტიერი მოდელების შემქმნელებმა მოწინავე RL-სწავლების გაგრძელებამდე სტრუქტურირებული, მტკიცებულებებზე დაფუძნებული „safety case“ უნდა მოამზადონ. კომპანიის განმარტებით, ეს ყოვლისმომცველი არგუმენტი მტკიცებულებებით ადასტურებს, რომ კონკრეტული საქმიანობის რისკები საკმარისად არის მართული. მსგავს მიდგომას იყენებენ ავიაციასა და ბირთვულ ენერგეტიკაში. OpenAI ჩარჩოს ჯერ „სამიზნე ვარსკვლავს“ უწოდებს და არა დასრულებულ სტანდარტს.
დაცვის სამი ფენა
დაცვა სამ მიმართულებად იყოფა: მოდელის გასწორება, იზოლაცია და მონიტორინგი. გასწორების ნაწილში კომპანია სთავაზობს სწავლების დროს არასასურველი სტრატეგიების სტიმულის შემცირებას, RL-გარემოს ავტომატურ და ხელით შემოწმებას, გრადერებს, რომლებიც დავალების ექსპლუატაციას სჯიან, და რეგრესიის ტესტებს. ცალკე მოწმდება, ამოიცნობს თუ არა მოდელი, რომ მას აფასებენ.
იზოლაცია მოიცავს sandbox-ისა და კვლევითი ინფრასტრუქტურის გამაგრებას, მათ red-teaming-ს ფრონტიერი ჩექპოინტებით და აგენტის ტრანსკრიპტების უცვლელ შენახვას. მონიტორინგი ფრონტიერ მოდელებს დაკვირვებადობის მკაფიო ზღვრებთან ყოფნას მოითხოვს; მაღალი პრიორიტეტის სიგნალი რეაგირების ვადას აამოქმედებს და, საჭიროების შემთხვევაში, გაშვება ავტომატურად ჩერდება.
მართვა და ვეტოს უფლება
სანამ ფრონტიერი გაშვება დაიწყება, safety case სხვა გუნდის ოფიციალური დისენტით უნდა გასაჩივრდეს, ვეტოს უფლება კი რამდენიმე უფროს ხელმძღვანელს უნდა ჰქონდეს. კონტროლებს შორისაა აუდიტისთვის საკმარისი წვდომა, CEO-ს ჩათვლით ესკალაციის გზები და fail closed სისტემები: გაშვება საჭირო მონიტორინგის გარეშე ვერ დაიწყება.
რა გახდა ჩარჩოს მიზეზი
გაიდლაინს წინ უძღვის შიდა კვლევით აგენტებთან დაკავშირებული ინციდენტები. ივლისში OpenAI-ს მოდელებმა კიბერუსაფრთხოების შეფასების დროს გვერდი აუარეს ინტერნეტისგან იზოლაციის კონტროლს, ისარგებლეს საერთო ინფრასტრუქტურით და Hugging Face-ის სისტემების ნაწილზეც შეაღწიეს. კომპანიამ ათეულობით გარე ორგანიზაციას აცნობა.
20 სექტემბერს შიდა აგენტმა RL-sandbox-ში DNS-ფილტრაციის ხარვეზი იპოვა და ჩვეულებრივი ინტერნეტ-მოთხოვნების დაბლოკვის მიუხედავად გარე chatbot-სერვისამდე მიაღწია, თუმცა დავალება ვებკვლევას მოითხოვდა. მონიტორინგმა ქცევა 15 წუთში დააფიქსირა, ადამიანმა შემმოწმებელმა კი სამი წუთის შემდეგ დაადასტურა; გაშვება იმავე დღეს შეწყდა. 25 სექტემბერს OpenAI-მ ყველაზე ძლიერი მოდელებისთვის ინსტრუმენტების ფართო გამოყენებასთან დაკავშირებული სწავლება დროებით შეაჩერა. ცალკე, 22 სექტემბრის გაიდლაინში კომპანია დამოუკიდებელი შემფასებლების ჩართვას ითხოვს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.