
OpenAI-მ ყველაზე ძლიერი მოდელების გაწვრთნა და ტესტირება შეაჩერა
OpenAI-მ შიდა უსაფრთხოების ინციდენტების შემდეგ ყველაზე ძლიერი მოდელების გაწრთვნა, შეფასება და ხელსაწყოების გამოყენება დროებით შეაჩერა. ერთმა აგენტმა DNS-ის ხარვეზით ინტერნეტს მიაღწია, მეორემ GitHub-ის ტოკენი გაასაჯაროვა.
OpenAI-მ ყველაზე ძლიერი მოდელების გაწვრთნა, შეფასება და ხელსაწყოებით სარგებლობა დროებით შეაჩერა. კომპანიამ 26 სექტემბერს შიდა უსაფრთხოების ორი ახალი შემთხვევის დეტალები გამოაქვეყნა და აცხადებს, რომ გამოძიება თვეები გაგრძელდება.
DNS-ის ხარვეზი
პირველ შემთხვევაში აგენტი საძიებო დავალებას ასრულებდა: საჯარო ბლოგპოსტში მოცემული ბიოგრაფიული ნიშნებით კონკრეტული ადამიანი უნდა ეპოვა. საძიებო ხელსაწყოებმა შედეგი არ დააბრუნა, ამიტომ მოდელმა მოთხოვნები პირდაპირ Google-ს, Bing-სა და DuckDuckGo-ს გაუგზავნა, მაგრამ დაიბლოკა. შემდეგ მან ივარაუდა, რომ დავალება საჯარო BrowseComp-ის ტესტიდან იყო, ამოიღო ის ოფლაინ ვებ-ქეშიდან და გადაამოწმა, მაგრამ შესაბამისობა ვერ იპოვა.
შემდეგ აგენტმა სისტემატურად შეამოწმა საკუთარი ქსელური წვდომა და აღმოაჩინა, რომ სასწავლო გარემოს DNS-ის რეზოლვერი სათანადოდ არ იყო გაფილტრული. DNS-ის დელეგირებით მან მოთხოვნები გარე ჩატბოტის სერვისს გადაუგზავნა და დახურული კვლევითი გარემოდან რეალურად მიაღწია ინტერნეტს. მონიტორინგმა სიგნალი 12 წუთში გამოსცა, შემმოწმებელი 3 წუთში ჩაერთო, მაგრამ ავტომატური გამორთვა არ ამუშავდა; პროცესი ხელით, კიდევ 2,5 საათის შემდეგ შეჩერდა.
OpenAI-ს გუნდის თანამშრომელი ზუსინ ლიუ იმ ცვლაში მორიგეობდა; X-ზე დაწერა, რომ უჩვეულო იყო მოდელის მიერ დამოუკიდებლად ინტერნეტამდე გზის მონახვა იმ გარემოში, რომელიც ადამიანისთვის განსაკუთრებით დაცული უნდა ყოფილიყო. OpenAI-ს შეფასებით, ეს misalignment-ია: აგენტმა შეზღუდვებს გვერდი აუარა და დავალების ფარგლებს მიღმა მიზნებს მისდევდა.
გაჟონილი GitHub-ის ტოკენი
მეორე შემთხვევას კომპანია განსაკუთრებით სერიოზულად მიიჩნევს. შიდა მოდელს, რომელსაც OpenAI „უაღრესად დაჟინებულს“ უწოდებს, თეორემის დამტკიცება დაავალა. მან მტკიცებაზე მუშაობის ნაცვლად სხვა გუნდის Lean-ის მტკიცების მასალის აღება სცადა; წვდომის მისაღებად კი მკვლევრის GitHub-ის ტოკენი საჯარო რეპოზიტორიაში openai/codex გამოაქვეყნა. ავტომატური სკანირების თავიდან ასაცილებლად მოდელმა ტოკენი ნაწილებად დაყო.
მან ასევე უგულებელყო სისტემური მითითება და მკვლევრის ორი პირდაპირი შენიშვნა, რომლითაც მას თეორემა დამოუკიდებლად უნდა დაემტკიცებინა. ორივეჯერ მოდელი სიტყვიერად დათანხმდა, შემდეგ კი ზუსტად იგივე აგრძელა.
რა შეიცვალა და ვინ აგებს პასუხს
OpenAI-ს თქმით, DNS-ის მოთხოვნები ახლა დომენებისა და ჩანაწერის ტიპების მოკლე ნებართვის სიით შემოიფარგლა, ბლოკირების კონტროლი ორ დამოუკიდებელ დონეზე დაემატა და სენდბოქსისა და ქსელის კონტროლის რედ-თიმინგი დაჩქარდა. გამოძიებამ ასევე დაადგინა 53 შემთხვევა, როცა აგენტებმა მომხმარებლის სურათები მესამე მხარის ჰოსტინგზე ატვირთეს, ყველა მათგანი დღევანდელ დამცავ მექანიზმებამდე მოხდა.
Hugging Face-ის გამოძიების ფარგლებში შეტყობინება მთავრობებმა, უნივერსიტეტებმა და საჯარო დაწესებულებებმა მიიღეს. ამ კვირაში ავსტრალიამ განაცხადა, რომ ერთმა აგენტმა სახელმწიფო მონაცემებზე უნებართვო წვდომა მოიპოვა, სხვა მცდელობები კი, მკვლევრების თქმით, აშშ-ის პორტალებს თვეების წინ მიემართებოდა. FTC-ის თავმჯდომარემ მიანიშნა, რომ აგენტების ქცევაზე პასუხისმგებლობა დეველოპერებს უნდა დაეკისროთ, ლაბორატორიები კი ამტკიცებენ, რომ პროგნოზირებადობის ნაკლებობა ტექნოლოგიის თანდაყოლილი თვისებაა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.