
OpenAI تطلق MentalHealthBench، معيارًا مفتوحًا لتقييم ردود AI في محادثات الصحة النفسية الواقعية
أطلقت OpenAI معيار MentalHealthBench المفتوح، الذي طُوِّر مع أكثر من 80 خبيرًا مرخّصًا في الصحة النفسية من 22 دولة، لتقييم ردود أنظمة AI في محادثات واقعية حول الصحة النفسية.
أطلقت OpenAI في 23 سبتمبر معيار MentalHealthBench المفتوح، وهو أداة تقيس مدى جودة ردود أنظمة AI في محادثات واقعية حول الصحة النفسية. وتقول الشركة إن المعيار طُوِّر بالتعاون مع أكثر من 80 طبيبًا نفسيًا وطبيبًا للطب النفسي مرخّصين من 22 دولة.
يستخدم أكثر من مليار شخص ChatGPT أسبوعيًا، وهم يطرحون عليه موضوعات شخصية متزايدة: العلاقات، والضغوط اليومية، ولحظات الأزمات. وتشير OpenAI إلى أن معظم التقييمات السابقة ركّزت على سيناريوهات الطوارئ، ما ترك سؤالًا مفتوحًا حول سلوك النماذج في المحادثات اليومية الأقل حدة.
ماذا يشمل المعيار
يضم MentalHealthBench 1,215 محادثة اصطناعية أُنشئت بتقنيات تحافظ على الخصوصية وتعكس أنماط الاستخدام الفعلية. ومن هذه المحادثات، 53.5% غير حادة، و18.2% عالية الحدة، و28.3% تتعلق بحالات طارئة. ويشكّل البالغون 68.1% من الشخصيات، والمراهقون بين 13 و17 عامًا 21.2%، ومقدّمو الرعاية 4.9%، والأطباء الإكلينيكيون 5.8%.
راجع كل محادثة ثلاثة خبراء على الأقل، ووضعوا معايير تقييم تتراوح أوزانها بين −10 و+10: النقاط الموجبة تكافئ السلوك المفيد، والسلبية تعاقب السلوك الضار. ولم يبقَ في المعيار النهائي إلا المعايير التي اتفق عليها خبيران على الأقل ولم يعارضها الثالث. ويقيّم نموذج تدقيق آلي يُدعى GPT-5.6 Sol ردود النماذج، وتتوزع النتيجة الإجمالية على عشرة أبعاد سلوكية، منها جمع السياق، والتعاطف، والدقة الإكلينيكية، وضبط درجة الإلحاح.
قيّمت OpenAI عدة نماذج على المعيار: حصل GPT-6 Astra على 57.3%، وGPT-6 Sol على 53.9%، وClaude Opus 5.5 على 52.4%.
الخبراء مقابل المستخدمين
أجرت OpenAI دراسة منفصلة مع 44 بالغًا من 16 دولة استخدموا AI للمساندة النفسية أو العاطفية. وقيّم المشاركون ردود المحادثات غير الحادة فقط، لتجنّب تعريضهم لمحتوى مؤلم. وأبدى المستخدمون تقديرًا خاصًا للخطوات العملية التالية وللأسلوب، بينما ركّز الخبراء على جمع السياق وتفسير المواقف الغامضة بحذر. وتقول الشركة إن وجهة نظر المستخدمين تكمّل الحكم الخبير ولا تحلّ محله؛ إذ تبقى المعايير النهائية قائمة على توافق الخبراء.
لماذا يهم ذلك
نُشر المعيار بشكل مفتوح، فيمكن للباحثين فحص المنهجية وتشغيل تقييماتهم الخاصة والبناء على هذا العمل، كما تستطيع شركات أخرى قياس نماذجها بالمعايير نفسها ومقارنة النتائج. وتشدّد OpenAI على أن ChatGPT ليس بديلًا عن العلاج أو الرعاية المهنية.
وقالت الشركة أيضًا إنها عزّزت ردود ChatGPT في المحادثات الحساسة، ووسّعت الوصول إلى موارد الأزمات، وأضافت ميزة Trusted Contact. وبحسب تقديرها، لا يغطي أي معيار كل ما يهم في محادثة شخصية، لكن MentalHealthBench يهدف إلى وضع معيار أعلى.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.