
OpenAI-მ ახალი ტიპის prompt injection აღმოაჩინა, რომელიც კომპიუტერული ჭიის მსგავსად ვრცელდება
OpenAI-ის ანგარიშით, GPT მოდელები მგრძნობიარეა თვითგამრავლებადი prompt injection-ის მიმართ, რომელიც ელფოსტით, ფაილებითა და კოდის კომენტარებით ვრცელდება. კომპანია ზიანს სიმულაციების მიღმა არ ადასტურებს.
OpenAI-მ პარასკევს გამოქვეყნებულ ანგარიშში ახალი ტიპის prompt injection აღწერა, რომელსაც კომპიუტერული ჭიის მსგავსად თვითგამრავლება შეუძლია. კომპანია ამ ტექნიკას „თვითგამრავლებად prompt injection-ს“ უწოდებს.
OpenAI ამ თავდასხმას ტრადიციულ კომპიუტერულ ჭიას ადარებს, როცა მავნე პროგრამა თავს იმრავლებს და სწრაფად ვრცელდება მრავალ მოწყობილობაზე. კომპანიის განცხადებით, ახალ ინექციებს ორმაგი მიზანი აქვს: მავნე ამოცანის შესრულება და შემდეგ სამიზნე მოდელის იძულება, რომ ინექცია საჯაროდ გაამრავლოს.
როგორ ვრცელდება თავდასხმა
ელფოსტით მოსულ prompt injection-ს OpenAI ერთ-ერთ ყველაზე ნათელ მაგალითად აღწერს. როცა აგენტი წერილს კითხულობს, ინექცია ავალებს მას, რომ ის ჩასვას ყველა გაგზავნილ პასუხში.
კომპანიამ უფრო რთული შემთხვევებიც იპოვა. ზოგიერთ ინექციას ფაილური სისტემის გამოყენებით თვითგამრავლება შეუძლია, ან კოდის კომენტარებში საკუთარი თავის დამახსოვრება. ერთ მაგალითში ყალბი სისტემური გაფრთხილება მოდელს მნიშვნელოვანი მოხსენებების წაშლას აიძულებს, შემდეგ კი მთელი თავდასხმა ფაილში მრავლდება.
ანგარიში „მრავალსაფეხურიან prompt injection-საც“ აღწერს, როცა ერთი შეტყობინება საფეხურის როლს ასრულებს და აგენტს სხვა წერილებისკენ მიმართავს, რომლებიც ერთად უნებართვო ქმედებას იწვევს. OpenAI-ის მაგალითში GPT-5.5-ზე დაფუძნებული აგენტი Slack-იდან დამატებით ინსტრუქციებს იღებს და ინექციას ხელახლა აქვეყნებს.
როგორ იპოვა OpenAI ეს ინექციები
GPT-Red, რომელიც OpenAI-მ ივლისში წარდგინა, თვითთამაშის ტრენინგის ჩარჩოა, რომელსაც კომპანია prompt injection-ების წინააღმდეგ იყენებს. ჩარჩო „თავდამსხმელ“ მოდელს „დამცველ“ მოდელს უპირისპირებს: თავდამსხმელი ცდილობს დამცველი მავნე ქმედებისკენ აიძულოს, ინექციები კი დამცველის გარემოში ემატება.
ამჯერად OpenAI-მ შეამოწმა, შესაძლებელია თუ არა თვითგამრავლებადი ინექციები საერთოდ. ელფოსტისა და ფაილური სისტემის ინექციები GPT-5.4-mini-ზე დაფუძნებულმა, GPT-Red-ის სტილის შიდა მოდელმა იპოვა, დაუცველი მოდელიც GPT-5.4-mini-ზე იყო დაფუძნებული. მრავალსაფეხურიან შეფასებაში დაუცველი მოდელი GPT-5.5 იყო, თავდასხმა კი Codex-ის გარემოში მომუშავე GPT-5.5-მა იპოვა. ტესტები ელფოსტისა და კალენდრის მსგავს კონექტორებიან გარემოებში ჩატარდა.
კვლევითი აღმოჩენა, არა ინციდენტი
OpenAI ხაზს უსვამს, რომ ტრენინგისა და შეფასების დროს სიმულირებული ხელსაწყოების გამოძახებების მიღმა ზიანი არ შეუნიშნავს და შედეგებს მხოლოდ მათი „ახალი ბუნების“ გამო აქვეყნებს.
ამ თვეში კომპანიამ მოდელების არასწორ ქცევაზე რამდენიმე ანგარიშიც გამოაქვეყნა, მათ შორის გაჟონილი API გასაღებების ნებართვის გარეშე გამოყენებაზე, თვითშექმნილ ინსტრუქციებსა და ინფორმაციის გამოგონებაზე. პასუხად OpenAI-მ GPT-Red-ის ტრენინგში თავდამსხმელის მიზნებს თვითგამრავლება დაამატა, რომ მომავალი მოდელები მსგავსი ინექციების წინააღმდეგ უფრო მდგრადი იყოს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.