
OpenAI випустила MentalHealthBench — відкритий бенчмарк для оцінки відповідей AI у розмовах про психічне здоров’я
OpenAI представила MentalHealthBench — відкритий бенчмарк, створений разом із понад 80 ліцензованими фахівцями з психічного здоров’я з 22 країн, для оцінки відповідей AI у реалістичних розмовах.
OpenAI представила MentalHealthBench 23 вересня — відкритий бенчмарк, який вимірює, наскільки добре AI-системи відповідають у реалістичних розмовах про психічне здоров’я. За словами компанії, бенчмарк створено разом із понад 80 ліцензованими психологами та психіатрами з 22 країн.
Понад мільярд людей користуються ChatGPT щотижня і дедалі частіше звертаються до нього з особистими темами: стосунками, повсякденним стресом, кризовими моментами. OpenAI зазначає, що більшість попередніх оцінювань зосереджувалися на невідкладних сценаріях, тому залишалося нез’ясованим, як моделі поводяться в ширшому спектрі щоденних, менш гострих розмов.
Що охоплює бенчмарк
MentalHealthBench містить 1215 синтетичних розмов, створених із застосуванням методів захисту приватності, що відтворюють реальні моделі використання. 53,5% розмов стосуються щоденних тем без загострення, 18,2% — високої гостроти, а 28,3% — невідкладних ситуацій. Дорослі становлять 68,1% персонажів, підлітки 13–17 років — 21,2%, опікуни — 4,9%, клініцисти — 5,8%.
Кожну розмову переглянули щонайменше троє експертів: вони сформулювали критерії рубрики з вагами від −10 до +10, де позитивні бали винагороджують корисну поведінку, а негативні карають шкідливу. До фінальної рубрики потрапили лише критерії, з якими погодилися щонайменше двоє експертів і які не заперечив третій. Відповіді моделей оцінює автоматичний суддя GPT-5.6 Sol, а підсумковий бал розкладається на десять вимірів поведінки — зокрема пошук контексту, емпатію, клінічну точність і калібрування нагальності.
OpenAI перевірила на бенчмарку кілька моделей: GPT-6 Astra отримала 57,3%, GPT-6 Sol — 53,9%, Claude Opus 5.5 — 52,4%.
Експерти та користувачі
Окреме дослідження OpenAI провела з 44 дорослими з 16 країн, які користувалися AI для психічної чи емоційної підтримки. Учасники оцінювали відповіді лише в не гострих розмовах, щоб не наражати їх на травмівний матеріал. Користувачі найбільше цінували практичні наступні кроки та тон, тоді як експерти наголошували на зборі контексту й обережній інтерпретації неоднозначних ситуацій. Компанія зазначає, що думка користувачів доповнює, але не замінює експертну; остаточні критерії оцінювання базуються на консенсусі експертів.
Чому це важливо
Бенчмарк опубліковано відкрито: дослідники можуть вивчати методологію, проводити власні оцінювання та розвивати цю роботу, а інші розробники — вимірювати свої моделі за тією самою рубрикою. OpenAI наголошує, що ChatGPT не замінює терапію чи професійну допомогу.
Компанія також повідомила, що посилила відповіді ChatGPT у чутливих розмовах, розширила доступ до кризових ресурсів і додала Trusted Contact. За її визнанням, жоден бенчмарк не охоплює всього, що має значення в особистій розмові, але MentalHealthBench має задати вищу планку.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.