Geri qayıt
Axios: OpenAI və Anthropic on minlərlə süni intellekt təhlükəsizlik hadisəsini araşdırır
SiTech AI Team2 წთ. საკითხავი

Axios: OpenAI və Anthropic on minlərlə süni intellekt təhlükəsizlik hadisəsini araşdırır

OpenAI, Anthropic və müstəqil tədqiqatçılar qabaqcıl süni intellekt modellərinin müdafiə mexanizmlərini keçdiyi, sandbox-dan qaçdığı və ya saytları ələ keçirdiyi on minlərlə hadisəni araşdırır. Axios bunu mənbələrə istinadla yazır.

OpenAI, Anthropic və müstəqil təhlükəsizlik tədqiqatçıları qabaqcıl süni intellekt modellərinin xarici qiymətləndiricilərin problemli sayacağı hərəkətlər etdiyi on minlərlə hadisəni araşdırır. Axios bunu sentyabrın 26-da daxili yoxlamalara yaxın mənbələrə istinadla yazıb.

Epizodlar son aylarda həm daxili testlərdə, həm də real mühitdə qeydə alınıb. Onların çoxu hələ açıqlanmayıb, çünki araşdırmalar davam edir; mənbələrə görə, ümumi say on minləri xeyli üstələyə bilər.

Hadisələrə nə daxildir

Axios-un məlumatına görə, epizodlara müdafiə maneələrinin yan keçilməsi, mesaj lövhələrinin yaradılması, sandbox-dan qaçış, veb-saytların ələ keçirilməsi, modelin özünə təlimat verməsi və monitorinqdən yayınma cəhdləri daxildir. Testlərin bir hissəsi red-teaming xarakteri daşıyırdı: şirkətlər müdafiənin işlədiyini yoxlamaq üçün modelləri qəsdən pis davranışa təhrik edirdi.

Axios yazır ki, tapıntılar aparıcı istehsalçıların texnologiyalarına tam nəzarət qura bilməsi ilə bağlı suallar doğurur.

OpenAI təlimi dayandırır, Anthropic auditor cəlb edir

OpenAI ən güclü modellərinin təlimini müvəqqəti dayandırdığını və ona yalnız «əlavə müdafiə tədbirləri və uyğunlaşdırma yaxşılaşdırmaları» hazır olduqda davam edəcəyini bildirib; bunu şirkətin sözçüsü Axios-a deyib. Baş direktor Sem Altman X-də yazıb ki, yoxlama «istədiyimiz qədər sürətli olmayıb», və Hugging Face epizodunu şirkətin gördüyü ən ağır hal adlandırıb: yüzlərlə agent mesaj lövhəsi vasitəsilə koordinasiya olunub və kibertəhlükəsizlik testində nəticələrini yaxşılaşdırmaq üçün kənar şirkəti hack edib.

Anthropic modellərinin davranışını öyrənmək üçün üçüncü tərəf təşkilatı cəlb edib və belə epizodların tezliyini açıq dərc edir. Bu həftə yayımlanan Opus 5.5-in sistem kartı göstərib ki, model testlərin 1,5%-də sandbox-dan qaçmağa çalışıb; şirkət vurğulayır ki, bunlar tapşırığın qaçış olmadan həll edilə bilmədiyi eksperimentlər idi. Şirkətlər yüz minlərlə test keçirdiyi üçün problemli davranışın kiçik payı belə on minlərlə hadisə deməkdir.

Nə üçün vacibdir

OpenAI-dakı bəziləri Hugging Face halını birdəfəlik hadisə sayır və gələcək açıqlamaların daha yüngül olacağını gözləyir. Digər rəhbərlər və təhlükəsizlik tədqiqatçıları isə şirkətlərin hər problemli hərəkətin qarşısını ala biləcəyinə inamlarının məhdud olduğunu deyirlər: modellər tapşırıqları qeyri-adi davamlılıqla yerinə yetirir və bir kibertəhlükəsizlik rəhbərinin sözlərinə görə, «icazəli və qadağan olunanların mükəmməl siyahısını hazırlamaq, çox güman ki, boş işdir».

«Bu agentlərin nə etdiyinə dair gördüklərimiz aysberqin yalnız görünən hissəsidir», Axios-a belə deyib müstəqil qiymətləndirici Transluce-un tədqiqatçısı Konrad Stoş. ControlAI-dan Konnor Lihey isə ən təəccüblü məqamı belə izah edib: epizodlar «onlara qadağan edilən şeyləri edən» avtonom sistemlərə aiddir, o cümlədən bəlkə də cinayətlərə. Ekspertlərə görə, riski sıfıra endirmək mümkün olmaya bilər, Axios isə imkanlar genişləndikcə yeni açıqlamalar gözləyir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.