Назад
OpenAI випустила MentalHealthBench — відкритий бенчмарк для оцінки відповідей AI у розмовах про психічне здоров’я
SiTech AI Team2 წთ. საკითხავი

OpenAI випустила MentalHealthBench — відкритий бенчмарк для оцінки відповідей AI у розмовах про психічне здоров’я

OpenAI представила MentalHealthBench — відкритий бенчмарк, створений разом із понад 80 ліцензованими фахівцями з психічного здоров’я з 22 країн, для оцінки відповідей AI у реалістичних розмовах.

OpenAI представила MentalHealthBench 23 вересня — відкритий бенчмарк, який вимірює, наскільки добре AI-системи відповідають у реалістичних розмовах про психічне здоров’я. За словами компанії, бенчмарк створено разом із понад 80 ліцензованими психологами та психіатрами з 22 країн.

Понад мільярд людей користуються ChatGPT щотижня і дедалі частіше звертаються до нього з особистими темами: стосунками, повсякденним стресом, кризовими моментами. OpenAI зазначає, що більшість попередніх оцінювань зосереджувалися на невідкладних сценаріях, тому залишалося нез’ясованим, як моделі поводяться в ширшому спектрі щоденних, менш гострих розмов.

Що охоплює бенчмарк

MentalHealthBench містить 1215 синтетичних розмов, створених із застосуванням методів захисту приватності, що відтворюють реальні моделі використання. 53,5% розмов стосуються щоденних тем без загострення, 18,2% — високої гостроти, а 28,3% — невідкладних ситуацій. Дорослі становлять 68,1% персонажів, підлітки 13–17 років — 21,2%, опікуни — 4,9%, клініцисти — 5,8%.

Кожну розмову переглянули щонайменше троє експертів: вони сформулювали критерії рубрики з вагами від −10 до +10, де позитивні бали винагороджують корисну поведінку, а негативні карають шкідливу. До фінальної рубрики потрапили лише критерії, з якими погодилися щонайменше двоє експертів і які не заперечив третій. Відповіді моделей оцінює автоматичний суддя GPT-5.6 Sol, а підсумковий бал розкладається на десять вимірів поведінки — зокрема пошук контексту, емпатію, клінічну точність і калібрування нагальності.

OpenAI перевірила на бенчмарку кілька моделей: GPT-6 Astra отримала 57,3%, GPT-6 Sol — 53,9%, Claude Opus 5.5 — 52,4%.

Експерти та користувачі

Окреме дослідження OpenAI провела з 44 дорослими з 16 країн, які користувалися AI для психічної чи емоційної підтримки. Учасники оцінювали відповіді лише в не гострих розмовах, щоб не наражати їх на травмівний матеріал. Користувачі найбільше цінували практичні наступні кроки та тон, тоді як експерти наголошували на зборі контексту й обережній інтерпретації неоднозначних ситуацій. Компанія зазначає, що думка користувачів доповнює, але не замінює експертну; остаточні критерії оцінювання базуються на консенсусі експертів.

Чому це важливо

Бенчмарк опубліковано відкрито: дослідники можуть вивчати методологію, проводити власні оцінювання та розвивати цю роботу, а інші розробники — вимірювати свої моделі за тією самою рубрикою. OpenAI наголошує, що ChatGPT не замінює терапію чи професійну допомогу.

Компанія також повідомила, що посилила відповіді ChatGPT у чутливих розмовах, розширила доступ до кризових ресурсів і додала Trusted Contact. За її визнанням, жоден бенчмарк не охоплює всього, що має значення в особистій розмові, але MentalHealthBench має задати вищу планку.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.