Geri qayıt
OpenAI psixi sağlamlıq söhbətlərində AI cavablarını qiymətləndirən MentalHealthBench-i təqdim edib
SiTech AI Team2 წთ. საკითხავი

OpenAI psixi sağlamlıq söhbətlərində AI cavablarını qiymətləndirən MentalHealthBench-i təqdim edib

OpenAI 22 ölkədən 80-dən çox lisenziyalı psixi sağlamlıq mütəxəssisi ilə hazırladığı MentalHealthBench açıq meyarını təqdim edib; meyar AI cavablarını real psixi sağlamlıq söhbətlərində qiymətləndirir.

OpenAI sentyabrın 23-də MentalHealthBench-i təqdim edib: açıq meyar olan bu alət AI sistemlərinin real psixi sağlamlıq söhbətlərində nə qədər yaxşı cavab verdiyini ölçür. Şirkətin məlumatına görə, meyar 22 ölkədən 80-dən çox lisenziyalı psixoloq və psixiatrla birlikdə hazırlanıb.

ChatGPT-dən hər həftə milyardan çox insan istifadə edir və istifadəçilər getdikcə daha şəxsi mövzuları ona danışır: münasibətlər, gündəlik stress və böhran anları. OpenAI qeyd edir ki, indiyədək aparılan qiymətləndirmələr əsasən təcili ssenarolara fokuslanıb və bu, modellərin gündəlik, daha yüngül söhbətlərdə necə davrandığını açıq sual kimi qoyub.

Meyar nələri əhatə edir

MentalHealthBench real istifadə nümunələrini əks etdirən və məxfilik qoruyan üsullarla yaradılmış 1.215 sintetik söhbət ehtiva edir. Söhbətlərin 53,5%-i kəskin olmayan mövzulara, 18,2%-i yüksək kəskinliyə, 28,3%-i isə təcili vəziyyətlərə aiddir. Personaların 68,1%-i yetkinlərdir; 13–17 yaşlı yeniyetmələr söhbətlərin 21,2%-ni, qayğı göstərənlər 4,9%-ni, klinisistlər isə 5,8%-ni təşkil edir.

Hər söhbəti ən azı üç mütəxəssis yoxlayıb. Onlar çəkiləri −10-dan +10-a qədər dəyişən qiymətləndirmə meyarları yazıb: müsbət ballar faydalı davranışı mükafatlandırır, mənfi ballar zərərlini cəzalandırır. Yekun rubrikaya yalnız ən azı iki mütəxəssisin razılaşdığı və üçüncünün etiraz etmədiyi meyarlar daxil edilib. Model cavablarını GPT-5.6 Sol adlı avtomatik qiymətləndirici ölçür; ümumi bal kontekstin toplanması, empatiya, klinik dəqiqlik və təcililik kalibrlənməsi daxil olmaqla on davranış ölçüsünə bölünür.

OpenAI meyar üzərində bir neçə modeli qiymətləndirib: GPT-6 Astra 57,3%, GPT-6 Sol 53,9%, Claude Opus 5.5 isə 52,4% nəticə göstərib.

Mütəxəssislər və istifadəçilər

OpenAI ayrıca 16 ölkədən 44 yetkinlə tədqiqat aparıb; onlar AI-dan psixi və ya emosional dəstək üçün istifadə etmişdilər. İştirakçılar yalnız kəskin olmayan söhbətlərə verdiyi cavabları qiymətləndirib ki, narahat edən materialın təsirinə məruz qalmasınlar. İstifadəçilər üçün xüsusilə praktik növbəti addımlar və ton vacib olub, mütəxəssislər isə kontekstin toplanmasına və qeyri-müəyyən vəziyyətin ehtiyatlı şərhinə üstünlük verib. Şirkət bildirir ki, istifadəçi baxışı ekspert rəyini tamamlayır, onu əvəz etmir; yekun meyarlar ekspert konsensusuna əsaslanır.

Nə üçün vacibdir

Meyar açıq şəkildə yayımlanıb: tədqiqatçılar metodologiyanı öyrənə, öz qiymətləndirmələrini aparı və bu işi inkişaf etdirə bilərlər. Bu, digər şirkətlərə də modellərini eyni rubrika ilə ölçmək və nəticələri müqayisə etmək imkanı verir. OpenAI ChatGPT-nin terapiyanı və ya peşəkar yardımı əvəz etmədiyini vurğulayır.

Şirkət həmçinin həssas söhbətlərdə ChatGPT-nin cavablarını gücləndirdiyini, böhran resurslarına çıxışı genişləndirdiyini və Trusted Contact funksiyasını əlavə etdiyini bildirib. Onun qiymətləndirməsinə görə, heç bir meyar şəxsi söhbətdə vacib olan hər şeyi əhatə edə bilməz, lakin MentalHealthBench daha yüksək standart müəyyən etməyi hədəfləyir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.