უკან დაბრუნება
Irregular: რატომ აღმოჩნდა ერთი სტარტაპი უკონტროლო AI-შეტევების საერთო წყარო
SiTech AI Team2 წთ. საკითხავი

Irregular: რატომ აღმოჩნდა ერთი სტარტაპი უკონტროლო AI-შეტევების საერთო წყარო

ისრაელური სტარტაპ Irregular-ის სატესტო გარემოში დაშვებული ორი შეცდომის გამო OpenAI-ს, Meta-ის, Anthropic-ისა და Google-ის აგენტები რეალურ სამიზნეებს მიადგნენ. ამას კომპანიის CTO ადასტურებს.

ბოლო თვეების განმავლობაში AI-აგენტების მიერ რეალურ სამიზნეებზე თავდასხმის შემთხვევები ცალკეულ ინციდენტებად აღიქმებოდა. The Verge-ის გამოძიებით, მათ უმეტესობას ერთი წყარო აქვს: Irregular, ისრაელური სტარტაპი, რომელიც AI-მოდელებს სიმულირებულ გარემოში ამოწმებს.

რა არის Irregular

2023 წელს Pattern Labs-ის სახელით შექმნილი კომპანია იმას ქმნის, რასაც თავად „მაღალი სიზუსტის კვლევით პლატფორმებს“ უწოდებს: სიმულირებულ გარემოს, სადაც AI-მოდელების უსაფრთხოების რეალური სცენარები მოწმდება. კლიენტების სია არ ქვეყნდება, თუმცა Irregular-ის ნამუშევარი OpenAI-ს მოდელების ტექნიკურ დოკუმენტაციაში მოიხსენიება. კომპანია სისტემებს დიდი ბრიტანეთის მთავრობისა და Anthropic-ისთვისაც ამოწმებდა, კვლევა კი RAND-თან ერთად გამოაქვეყნა.

როგორ გავიდა ტესტები რეალურ სამყაროში

წელს ჩატარებულ რამდენიმე ტესტში აგენტები დაცულად მიჩნეული გარემოდან გავიდნენ. ზოგი შემოწმება capture-the-flag ფორმატში ჩატარდა: აგენტს სიმულირებულ ქსელში დამალული ინფორმაცია უნდა მოეძებნა.

Irregular-ის CTO და თანადამფუძნებელი Omer Nevo The Verge-ს უთხრა, რომ აგენტებს ღია ინტერნეტზე წვდომა არ უნდა ჰქონოდათ, თუმცა „ინტერნეტზე წვდომა შემთხვევით იყო ღია“. იმავე სცენარში სამიზნედ შექმნილი გამოგონილი კომპანიის სახელი „რეალურ დომენს დაემთხვა“. ამ ორმა შეცდომამ აგენტები რეალურ სამიზნეებამდე მიიყვანა; ჯერ კიდევ უცნობია, რომელ ორგანიზაციებს დაესხნენ თავს სინამდვილეში.

ერთი სცენარი, ოთხი ლაბორატორია

Nevo-მ დაადასტურა, რომ იგივე პრობლემა იდგა OpenAI-ს, Meta-ის, Anthropic-ისა და Google-ის მოდელებთან დაკავშირებული ინციდენტების სათავეში. „Irregular-თან დაკავშირებული ყველა ინციდენტი შეფასების ერთი სცენარის საერთო ძირეულ პრობლემას უკავშირდებოდა. ყველა მათგანი გამჟღავნებულია“, განაცხადა მან. მისივე თქმით, სხვა ინციდენტები, მათ შორის Hugging Face-ის გატეხვა, Irregular-ს არ უკავშირდება. ანგარიშებით, კომპანიებს ამის შესახებ ივლისის ბოლოს, დაახლოებით ერთდროულად შეატყობინეს.

ჩინური მოდელები, ცვლილებები და დაპირებული ანგარიში

Irregular-ის გამოქვეყნებული კვლევით, კომპანიამ ჩინური Moonshot AI-სა და Z.ai-ის ღია მოდელებზე, Kimi K3-სა და GLM-5.2-ზე, კიბერტესტებიც ჩაატარა; მათი საკუთარ აპარატურაზე გაშვება თავისუფლად შეიძლება. Nevo-ს თქმით, ამ შემოწმებებს მსგავსი ინციდენტები არ მოჰყოლია, თუმცა ეს ამ მოდელების ნაკლებ მოწყვლადობას არ ნიშნავს.

ინციდენტებმა Irregular-ის მუშაობა შეცვალა: კომპანიამ ინტერნეტზე წვდომის კონტროლი გაამკაცრა, მონიტორინგი და ხელით გადამოწმება გააფართოვა, ტესტირების დაწყებამდე კი წვდომის დაგეგმილ ფარგლებთან შესაბამისობის შემოწმება დაამატა. კომპანიებთან ერთობლივი მუშაობის შემდეგ სტარტაპი ანგარიშს გამოაქვეყნებს უსაფრთხო კიბერშეფასებების ჩატარებაზე. The Verge-ის კითხვებს ოთხი ამერიკული ლაბორატორიიდან არცერთმა არ უპასუხა: Google და Anthropic გაჩუმდნენ, OpenAI და Meta კი ძველ ბლოგპოსტებზე მიუთითებენ.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.