
OpenAI, ruh sağlığı konuşmalarında AI yanıtlarını ölçen açık kıyaslama seti MentalHealthBench'i yayımladı
OpenAI, 22 ülkeden 80'den fazla lisanslı ruh sağlığı uzmanıyla geliştirdiği MentalHealthBench'i yayımladı; açık kıyaslama seti, AI yanıtlarını gerçekçi ruh sağlığı konuşmalarında değerlendiriyor.
OpenAI, 23 Eylül'de MentalHealthBench'i tanıttı: açık bir kıyaslama seti (benchmark) olan bu araç, AI sistemlerinin gerçekçi ruh sağlığı konuşmalarında ne kadar iyi yanıt verdiğini ölçüyor. Şirkete göre set, 22 ülkeden 80'den fazla lisanslı psikolog ve psikiyatristle birlikte geliştirildi.
ChatGPT'yi her hafta bir milyardan fazla kişi kullanıyor ve kullanıcılar giderek daha kişisel konuları ona taşıyor: ilişkiler, gündelik stres ve kriz anları. OpenAI, bugüne kadarki değerlendirmelerin çoğunlukla acil senaryolara odaklandığını, bunun da modellerin gündelik ve daha hafif konuşmalardaki davranışını belirsiz bıraktığını belirtiyor.
Kıyaslama seti neleri kapsıyor
MentalHealthBench, gerçek kullanım kalıplarını yansıtan ve gizliliği koruyan tekniklerle üretilmiş 1.215 sentetik konuşma içeriyor. Konuşmaların %53,5'i akut olmayan, %18,2'si yüksek akutluk düzeyinde, %28,3'ü ise acil durumlarla ilgili. Personaların %68,1'ini yetişkinler, %21,2'sini 13-17 yaş arası gençler, %4,9'unu bakım verenler ve %5,8'ini klinisyenler oluşturuyor.
Her konuşma en az üç uzman tarafından incelendi; uzmanlar ağırlıkları -10 ile +10 arasında değişen değerlendirme kriterleri yazdı. Olumlu puanlar yararlı davranışı ödüllendiriyor, olumsuzlar zararlı davranışı cezalandırıyor. Nihai rubriğe yalnızca en az iki uzmanın üzerinde anlaştığı ve üçüncüsünün itiraz etmediği kriterler girdi. Model yanıtlarını GPT-5.6 Sol adlı otomatik değerlendirici puanlıyor; toplam puan bağlam toplama, empati, klinik doğruluk ve aciliyet kalibrasyonu dahil on davranış boyutuna ayrılıyor.
OpenAI set üzerinde birçok modeli değerlendirdi: GPT-6 Astra %57,3, GPT-6 Sol %53,9 ve Claude Opus 5.5 %52,4 puan aldı.
Uzmanlar ve kullanıcılar
OpenAI ayrıca AI'ı ruh sağlığı ya da duygusal destek için kullanmış, 16 ülkeden 44 yetişkinle ayrı bir çalışma yürüttü. Katılımcılar yalnızca akut olmayan konuşmalardaki yanıtları değerlendirdi; böylece rahatsız edici içerikten korundular. Kullanıcılar özellikle pratik sonraki adımlara ve tona değer verirken, uzmanlar ilgili bağlamı toplamaya ve belirsiz durumları dikkatle yorumlamaya ağırlık verdi. Şirket, kullanıcı görüşünün uzman görüşünü tamamladığını ancak yerini almadığını belirtiyor; nihai kriterler uzman uzlaşmasına dayanıyor.
Neden önemli
Kıyaslama seti açık olarak yayımlandı: araştırmacılar yöntemi inceleyebilir, kendi değerlendirmelerini çalıştırabilir ve bu çalışmayı ileri taşıyabilir. Böylece diğer geliştiriciler de modellerini aynı rubrikle ölçüp sonuçları karşılaştırabilir. OpenAI, ChatGPT'nin terapi ya da profesyonel bakımın yerini tutmadığını vurguluyor.
Şirket ayrıca hassas konuşmalarda ChatGPT'nin yanıtlarını güçlendirdiğini, kriz kaynaklarına erişimi genişlettiğini ve Trusted Contact özelliğini eklediğini duyurdu. OpenAI'ye göre hiçbir kıyaslama seti kişisel bir konuşmada önemli olan her şeyi kapsayamaz, ancak MentalHealthBench daha yüksek bir standart belirlemeyi amaçlıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.