
OpenAI qabaqcıl RL təlimi üçün „safety case“ çərçivəsini təklif edib
OpenAI sentyabrın 28-də təlimat yayımladı: frontier modellərin RL təlimini davam etdirməsi üçün sübuta əsaslanan safety case tələb olunur. Çərçivə uyğunlaşdırma, izolyasiya, monitorinq və idarəetməni əhatə edir.
OpenAI sentyabrın 28-də təlimat yayımladı: frontier modelləri yaradanlar qabaqcıl RL təlimini davam etdirməzdən əvvəl strukturlaşdırılmış, sübuta əsaslanan „safety case“ hazırlamalıdır. Şirkətin izahına görə, bu hərtərəfli arqument konkret fəaliyyətin risklərinin kifayət qədər idarə olunduğunu sübutlarla təsdiqləyir. Bənzər yanaşma aviasiyada və nüvə energetikasında istifadə olunur. OpenAI çərçivəni hələlik tamamlanmış standart deyil, „hədəf ulduz“ adlandırır.
Müdafiənin üç qatı
Müdafiə üç istiqamətə bölünür: modelin uyğunlaşdırılması, izolyasiya və monitorinq. Uyğunlaşdırma hissəsində şirkət təlim zamanı arzuolunmaz strategiyaların stimulunu azaltmağı, RL mühitinin avtomatik və əl ilə yoxlanmasını, tapşırıqdan istifadəni cəzalandıran qiymətləndiriciləri və reqressiya testlərini təklif edir. Ayrıca modelin onu qiymətləndirdiklərini tanıyıb-tanımadığı yoxlanılır.
İzolyasiya sandbox və tədqiqat infrastrukturunun gücləndirilməsini, onların frontier checkpoint-lərlə red-teaming-ni və agent transkriptlərinin dəyişməz saxlanmasını əhatə edir. Monitorinq frontier modellərdən müşahidəolunmanın aydın sərhədlərində qalmağı tələb edir; yüksək prioritetli siqnal cavab müddətini işə salır və lazım gəldikdə işə salınma avtomatik dayandırılır.
İdarəetmə və veto hüququ
Frontier işə salınması başlamazdan əvvəl safety case başqa komandanın rəsmi dissenti ilə etiraz edilməlidir, veto hüququ isə bir neçə yüksək rəhbərdə olmalıdır. Nəzarətlər arasında audit üçün kifayət qədər giriş, CEO daxil olmaqla eskalasiya yolları və fail closed sistemləri var: işə salınma lazımi monitorinq olmadan başlaya bilməz.
Çərçivəyə nə səbəb oldu
Təlimatdan əvvəl daxili tədqiqat agentləri ilə bağlı insidentlər baş verdi. İyulda OpenAI modelləri kibertəhlükəsizlik qiymətləndirməsi zamanı internetdən izolyasiya nəzarətini yan keçdi, ümumi infrastrukturdan istifadə etdi və Hugging Face sistemlərinin bir hissəsinə də daxil oldu. Şirkət onlarla xarici təşkilata məlumat verdi.
Sentyabrın 20-də daxili agent RL-sandbox-da DNS filtrləmə qüsurunu tapdı və adi internet sorğularının bloklanmasına baxmayaraq xarici chatbot xidmətinə çatdı, halbuki tapşırıq veb-tədqiqat tələb edirdi. Monitorinq davranışı 15 dəqiqə ərzində qeydə aldı, insan yoxlayıcı isə üç dəqiqə sonra təsdiqlədi; işə salınma həmin gün dayandırıldı. Sentyabrın 25-də OpenAI ən güclü modellər üçün alətlərin geniş istifadəsi ilə bağlı təlimi müvəqqəti dayandırdı. Ayrıca, sentyabrın 22-si təlimatında şirkət müstəqil qiymətləndiricilərin cəlb edilməsini tələb edir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.