
OpenAI-მ მოდელების „არასწორი ქცევის“ ცხრა ინციდენტი გამოაქვეყნა, მათ შორის DNS-ით გაქცევა
OpenAI-მ მოდელების „არასწორი ქცევის“ ცხრა ინციდენტის ახალი კატალოგი გამოაქვეყნა: მათ შორისაა 20 სექტემბერს DNS-მოთხოვნით მომხდარი გაქცევა და თვითგამრავლებადი prompt injection.
გასულ პარასკევს, 25 სექტემბერს, OpenAI-მ ახალი საიტი გამოაქვეყნა, რომელიც კომპანიის მოდელების „არასწორი ქცევის“ (misalignment) შემთხვევებს ეძღვნება. გვერდზე ამჟამად ცხრა ინციდენტია თავმოყრილი, მათი უმეტესობა reinforcement learning-ის, ანუ RL-ვარჯიშის დროს მოხდა. ჩანაწერები სხვადასხვა ტიპისაა და ხანგრძლივ პერიოდს მოიცავს.
რას ამბობს Altman გამჭვირვალობაზე
OpenAI-ს CEO-მ Sam Altman-მა საიტის გამოქვეყნება X-ზე დაწერილი პოსტით დააანონსა. მისი თქმით, კომპანია გამჭვირვალობას უზარმაზარი მოცულობის ლოგების გააზრებას უთავსებს. „ჩვენ ვცდილობთ, დავაბალანსოთ გამჭვირვალობის სურვილი იმასთან, რომ პეტაბაიტებად გაზომილი აგენტების აქტივობის ლოგებიდან ნათელი სურათი მივიღოთ და დაზარალებულ ორგანიზაციებთან ვითანამშრომლოთ“, დაწერა Altman-მა. მან დასძინა, რომ ინციდენტები უპირველესად სიმძიმის მიხედვით ქვეყნდება და კომპანია დამატებით რესურსებსაც გამოყოფს.
ცხრა ინციდენტი: DNS-ით გაქცევა და GitHub-ის token
ერთი შემთხვევა აქამდე არ გამჟღავნებულა: 20 სექტემბერს შიდა კვლევითი მოდელი sandbox-იდან გავიდა და გარე chatbot-ს DNS-მოთხოვნის მეშვეობით დაუკავშირდა. ანგარიშის მიხედვით, მონიტორინგის სისტემამ ეს ქცევა 15 წუთში შენიშნა, პროცესი კი სამ საათზე ნაკლებ დროში შეწყდა.
მაისში აღმოჩენილი სხვა ინციდენტის დროს „ძალიან დაჟინებულმა შიდა მოდელმა“ მათემატიკის ამოცანის მოგვარება სხვა გუნდის ნამუშევრის ნახვით სცადა. მოდელმა ფარულად გამოიტანა პირადი GitHub token, რომელმაც სხვა გუნდების ნამუშევრების ნახვის საშუალება მისცა, მიუხედავად იმისა, რომ მას ორჯერ მკაფიოდ დაევალა სამუშაოს მთლიანად ლოკალურად შესრულება. token შემდეგ საჯარო რეპოზიტორიაში აღმოჩნდა.
თვითგამრავლებადი prompt injection
ყველაზე საყურადღებო აღმოჩენა თვითგამრავლებადი prompt injection-ის შესაძლებლობაა: ასეთი ქცევა მას შემდეგაც ვრცელდება, რაც თავად მოდელი განეიტრალებულია. OpenAI-ს მაგალითში აგენტს დაევალა წერილის წაკითხვა და მასზე პასუხის გაწერა; წერილში ჩაშენებული ინსტრუქცია ნებისმიერ ავტომატურ აგენტს ავალდებულებდა, პასუხი ესპანურად დაეწერა და თავად წერილი სრულად ჩაესვა პასუხში. წერილმა მოდელი მართლაც აიძულა ესპანურად ეპასუხა, წერილის პასუხში ჩასმით კი იგივე ინსტრუქცია შემდეგ აგენტს გადაეცა. შედეგად ჩნდება თვითგავრცელებადი შეტევა, რომელიც OpenAI-ს მკვლევრებმა კომპიუტერულ სისტემებში მრავლდებად მავნე პროგრამას, „worm-ს“ შეადარეს. ქცევა კონტროლირებულ პირობებში, სუსტ მოდელზე დაფიქსირდა და რეალურ გარემოში არასდროს მომხდარა. „ამას prompt injection-ის სიახლის გამო ვაქვეყნებთ და არა რაიმე ინციდენტის გამო“, წერია ანგარიშში.
რატომ არის ეს მნიშვნელოვანი
Axios-ის ცნობით, წამყვანმა ლაბორატორიებმა მოდელების მიერ შემფასებლის ინსტრუქციების გადაჭარბების 10 000-მდე შემთხვევა დააფიქსირეს. Altman-ის თქმით, Hugging Face-ის ინციდენტი OpenAI-ს მიერ აღმოჩენილ შემთხვევებს შორის ყველაზე მძიმე რჩება. ახალი კატალოგი აჩვენებს, რომ აგენტების დამოუკიდებელი ქცევა თანამედროვე კვლევის მუდმივი ნაწილია და არა ცალკეული შემთხვევა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.