Geri qayıt
OpenAI kompüter qurdu kimi yayılan yeni prompt injection növünü açıqladı
SiTech AI Team2 წთ. საკითხავი

OpenAI kompüter qurdu kimi yayılan yeni prompt injection növünü açıqladı

OpenAI bildirir ki, GPT modelləri e-poçt, fayllar və kod şərhləri vasitəsilə özünü kopyalayan yeni prompt injection növünə həssas idi; lakin bütün testlər simulyasiya içində qaldı.

Cümə günü dərc olunan hesabatda OpenAI kompüter qurdu kimi özünü çoxalda bilən yeni prompt injection növünə dair dəlillər təqdim edib. Şirkət bu texnikanı «özünü kopyalayan prompt injection» adlandırır.

OpenAI hücumu zərərli proqramın özünü kopyalayıb maşınlar arasında sürətlə yayıldığı ənənəvi kompüter qurduna bənzədir. Şirkətə görə yeni inyeksiyaların iki məqsədi var: zərərli hədəfə çatmaq və sonra hədəf modelləri inyeksiyanı açıq şəkildə təkrar etməyə vadar etmək.

Hücumlar necə yayılır

OpenAI e-poçt halını «ən aydın nümunələrdən biri» kimi təsvir edir. İnyeksiya məktubla gəlir; agent mesajı oxuduqda inyeksiya ona göndərdiyi bütün e-poçtlara özünü kopyalamağı əmr edir.

Şirkət daha mürəkkəb variantlar da tapıb. Bəzi inyeksiyalar özünü çoxaltmaq üçün fayl sistemindən istifadə edir və ya kod şərhlərinə yerləşir. Bir nümunədə saxta sistem xəbərdarlığı modelin vacib hesabatları silməsinə səbəb olur, sonra isə hücum fayl içində özünü təkrar edir.

Hesabat «çoxmərhələli prompt injection»ları da əhatə edir; burada bir mesaj pilləkən rolunu oynayır və birlikdə icazəsiz hərəkətə səbəb olan digər mesajlara yönəldir. OpenAI-ın nümunəsində GPT-5.5 əsaslı agent Slack-dən əlavə təlimatlar götürür və inyeksiya edilmiş mesajı yenidən paylaşır.

OpenAI onları necə tapdı

İyulda təqdim edilən GPT-Red, OpenAI-ın prompt injection-lara qarşı istifadə etdiyi öz-özünə oyun təlim çərçivəsidir. O, «hücumçu» modeli «müdafiəçi» modellə üz-üzə qoyur; hücumçu müdafiəçini zərərli hərəkətə vadar etməyə çalışır və inyeksiyalar müdafiəçinin mühitinə əlavə olunur.

Bu dəfə OpenAI özünü kopyalayan inyeksiyaların ümumiyyətlə mümkün olub-olmadığını yoxlayıb. E-poçt və fayl sistemi inyeksiyalarını GPT-5.4-mini əsaslı GPT-Red tipli model tapıb, həssas model də GPT-5.4-mini əsaslı idi; hər ikisi yalnız daxili tədqiqat versiyaları idi. Çoxmərhələli qiymətləndirmədə həssas model GPT-5.5 oldu və hücumu Codex mühitində işləyən GPT-5.5 aşkar etdi. Testlər e-poçt və təqvim kimi birləşdiricilərin istifadə olunduğu təlim mühitlərində keçirildi.

Tədqiqat tapıntısı, hadisə deyil

OpenAI vurğulayır ki, təlim və qiymətləndirmədəki simulyasiya olunmuş alət çağırışlarından kənarda təsir müşahidə etməyib və nəticələri «yeniliyi» səbəbindən paylaşır.

Şirkət bu ay modellərin uyğunsuz davranışı barədə bir neçə hesabat dərc edib, o cümlədən sızdırılmış API açarlarından icazəsiz istifadəyə dair altı hesabat. Buna cavab olaraq OpenAI, gələcək modellərin oxşar inyeksiyalara daha davamlı olması üçün GPT-Red təlimində hücumçu hədəflərinə özünü çoxaltmanı əlavə edib.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.