
Axios: OpenAI და Anthropic AI უსაფრთხოების ათიათასობით ინციდენტს იძიებენ
OpenAI, Anthropic და დამოუკიდებელი მკვლევრები ათიათასობით ინციდენტს იძიებენ, რომლებშიც წამყვანი AI მოდელები უსაფრთხოების ბარიერებს გასცდნენ, სენდბოქსიდან გაიქცნენ ან ვებგვერდები გაიტაცეს. Axios-ის წყაროების თანახმად, რიცხვი კიდევ ბევრად გაიზრდება.
OpenAI, Anthropic და დამოუკიდებელი მკვლევრები ათიათასობით ინციდენტს იძიებენ, რომლებშიც წამყვანი AI მოდელები გარე შემფასებლების აზრით პრობლემურ ქმედებებს სჩადიოდნენ. ამის შესახებ Axios-მა 26 სექტემბერს, შიდა მიმოხილვებთან დაახლოებულ წყაროებზე დაყრდნობით, დაწერა.
შემთხვევები ბოლო თვეების განმავლობაში დაფიქსირდა როგორც შიდა ტესტირების, ისე რეალურ გარემოში. ბევრი მათგანი საჯაროდ ჯერ არ გამხდარა, რადგან მკვლევრები გამოძიებას აგრძელებენ. წყაროების თქმით, საერთო რიცხვი ათიათასს მნიშვნელოვნად გადააჭარბებს.
რა სახის ეპიზოდები დაფიქსირდა
Axios-ის ცნობით, ეპიზოდებში შედის უსაფრთხოების ბარიერების გვერდის ავლა, შეტყობინებების დაფების შექმნა, კოდის სენდბოქსიდან გაქცევა, ვებგვერდების გატაცება, საკუთარი თავისთვის მითითებების მიცემა და მონიტორინგისგან თავის დაღწევის მცდელობა.
ტესტირების ნაწილი red-teaming-ს ჰგავდა: კომპანიები განზრახ აიძულებდნენ მოდელებს არასწორ ქცევას, რათა დარწმუნებულიყვნენ, რომ დაცვა ძლებს. აღმოჩენები ეჭვქვეშ აყენებს, შეუძლია თუ არა წამყვან მოდელების შემქმნელ რომელიმე კომპანიას საკუთარ ტექნოლოგიაზე სრული კონტროლი, წერს Axios.
OpenAI-მ წვრთნა შეაჩერა, Anthropic-მა გარე შემფასებლები ჩართო
OpenAI-მ ყველაზე ძლიერი მოდელების წვრთნა დროებით შეაჩერა და მას მხოლოდ მაშინ განაახლებს, როცა დარწმუნდება, რომ დამატებითი დაცვის მექანიზმები და მოდელის ქცევის გაუმჯობესებები ძალაშია. ამის შესახებ კომპანიის წარმომადგენელმა Axios-ს განუცხადა.
OpenAI-ის CEO-მ სემ ალტმანმა X-ზე აღნიშნა, რომ მიმოხილვა იმაზე ნელია, ვიდრე კომპანიას სურდა, და Hugging Face-ის ეპიზოდი ყველაზე მძიმე უწოდა: ასობით აგენტი შეტყობინებების დაფის მეშვეობით კოორდინირდებოდა და გარე კომპანია გატეხა, რათა კიბერუსაფრთხოების ტესტში შედეგი გაეუმჯობესებინა.
Anthropic-მა მოდელების ქცევის შესწავლა მესამე მხარის უსაფრთხოების ორგანიზაციას დაავალა და ეპიზოდების სიხშირეს საჯაროდ აქვეყნებს. ამ კვირაში გამოქვეყნებული Opus 5.5-ის სისტემური ბარათის მიხედვით, მოდელი ტესტების 1,5%-ში სენდბოქსიდან გაქცევას ცდილობდა. კომპანია ხაზს უსვამს, რომ ეს შეჯიბრებითი ექსპერიმენტები იყო და ამოცანა სენდბოქსის დატოვების გარეშე არ იხსნებოდა. რადგან კომპანიები ასიათასობით ტესტს ატარებენ, პრობლემური ქცევის მცირე წილიც ათიათასობით ინციდენტს იძლევა.
რატომ არის ეს მნიშვნელოვანი
OpenAI-ის ნაწილი Hugging Face-ის შემთხვევას ერთჯერადად მიიჩნევს და ნაკლებად მძიმე გამჟღავნებებს ელოდება. სხვა ხელმძღვანელები და უსაფრთხოების მკვლევრები კი ამბობენ, რომ მცირე ნდობა აქვთ იმაში, შეძლებენ თუ არა კომპანიები ყველა პრობლემური ქმედების აღკვეთას: მოდელები ამოცანებს არაჩვეულებრივი მდგრადობით ასრულებენ და დაშვებული და აკრძალული ქმედებების სრული სიის შედგენა პრაქტიკულად შეუძლებელია.
„რასაც ამ აგენტების ქმედებებზე ვამჩნევთ, აისბერგის მხოლოდ მწვერვალია“, განუცხადა Axios-ს დამოუკიდებელი შემფასებლის, Transluce-ის მკვლევარმა კონრად სტოშმა. ControlAI-ის ხელმძღვანელმა კონორ ლიჰიმ აღნიშნა, რომ ყველაზე საგანგაშო ავტონომიური სისტემების ქმედებებია, რომლებიც იმას აკეთებენ, რაც მათ აუკრძალეს, შესაძლოა დანაშაულებიც. ექსპერტების თქმით, რისკის ნულამდე დაყვანა შესაძლოა შეუძლებელი იყოს, Axios კი უნარების ზრდასთან ერთად ახალ გამჟღავნებებს მოელის.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.