Վերադառնալ
OpenAI-ը ներկայացրել է MentalHealthBench-ը, որ գնահատում է AI-ի պատասխանները հոգեկան առողջության զրույցներում
SiTech AI Team2 წთ. საკითხავი

OpenAI-ը ներկայացրել է MentalHealthBench-ը, որ գնահատում է AI-ի պատասխանները հոգեկան առողջության զրույցներում

OpenAI-ը ներկայացրել է MentalHealthBench բաց չափանիշը, որը ստեղծվել է 22 երկրի 80-ից ավելի լիցենզավորված մասնագետների հետ՝ գնահատելու AI-ի պատասխանները հոգեկան առողջության իրական զրույցներում։

OpenAI-ը սեպտեմբերի 23-ին ներկայացրել է MentalHealthBench-ը՝ բաց չափանիշ, որը գնահատում է, թե որքան լավ են AI համակարգերը պատասխանում հոգեկան առողջության իրական զրույցներում։ Ընկերության տվյալներով՝ չափանիշը ստեղծվել է 22 երկրի 80-ից ավելի լիցենզավորված հոգեբանների ու հոգեբույժների հետ։

ChatGPT-ն ամեն շաբաթ օգտագործում է ավելի քան մեկ միլիարդ մարդ, և օգտատերերն ավելի ու ավելի անձնական թեմաներ են վստահում նրան՝ հարաբերություններ, առօրյա սթրես և ճգնաժամային պահեր։ OpenAI-ի նշմամբ՝ նախկին գնահատումները հիմնականում կենտրոնացել են հրատապ սցենարների վրա, ուստի բաց էր մնում այն հարցը, թե ինչպես են մոդելները վարվում առօրյա, ավելի մեղմ զրույցներում։

Ինչ է ներառում չափանիշը

MentalHealthBench-ը ներառում է 1 215 սինթետիկ զրույց, որոնք ստեղծվել են գաղտնիությունը պաշտպանող մեթոդներով և արտացոլում են իրական օգտագործման օրինաչափությունները։ Զրույցների 53,5%-ը ոչ սուր է, 18,2%-ը՝ բարձր սրության, իսկ 28,3%-ը վերաբերում է հրատապ իրավիճակներին։ Օգտատերերի դերերից ամենահաճախը չափահասն է (68,1%), դեռահասները՝ 13–17 տարեկան, կազմում են զրույցների 21,2%-ը, խնամողները՝ 4,9%-ը, կլինիկական մասնագետները՝ 5,8%-ը։

Յուրաքանչյուր զրույց ստուգել է առնվազն երեք փորձագետ։ Նրանք կազմել են գնահատման չափանիշներ, որոնց կշիռը տատանվում է −10-ից +10-ի սահմաններում. դրական միավորները խրախուսում են օգտակար վարքը, իսկ բացասականները պատժում են վնասակարը։ Եզրափակիչ չափանիշում մնացել են միայն այն կետերը, որոնց համաձայնել է առնվազն երկու փորձագետ և չի հակադրվել երրորդը։ Մոդելների պատասխանները գնահատում է ավտոմատ գնահատիչ GPT-5.6 Sol-ը, իսկ ընդհանուր միավորը բաժանվում է վարքի տասը չափման՝ ներառյալ համատեքստի հավաքումը, էմպաթիան, կլինիկական ճշգրտությունը և հրատապության չափաբերումը։

OpenAI-ը չափանիշով գնահատել է մի քանի մոդել՝ GPT-6 Astra-ն ստացել է 57,3%, GPT-6 Sol-ը՝ 53,9%, իսկ Claude Opus 5.5-ը՝ 52,4%։

Փորձագետներն ու օգտատերերը

Առանձին ուսումնասիրությանը OpenAI-ը ներգրավել է 16 երկրի 44 չափահասի, ովքեր AI-ն օգտագործել են հոգեկան կամ էմոցիոնալ աջակցության համար։ Մասնակիցները գնահատել են միայն ոչ սուր զրույցների պատասխանները, որպեսզի չենթարկվեն ծանր նյութի ազդեցությանը։ Օգտատերերի համար առանձնապես կարևոր են եղել գործնական հաջորդ քայլերն ու տոնը, փորձագետների համար՝ համատեքստի հավաքումը և երկիմաստ իրավիճակի զգույշ մեկնաբանումը։ Ընկերությունը նշում է, որ օգտատիրոջ տեսակետը լրացնում, բայց չի փոխարինում փորձագիտականին. վերջնական չափանիշները հիմնված են մնում փորձագետների կոնսենսուսի վրա։

Ինչու է սա կարևոր

Չափանիշը հրապարակվել է բաց՝ հետազոտողները կարող են ուսումնասիրել մեթոդաբանությունը, անցկացնել սեփական գնահատումներ և զարգացնել այս աշխատանքը։ Դա հնարավորություն է տալիս նաև այլ ընկերությունների չափել սեփական մոդելները նույն չափանիշով և համեմատել արդյունքները։ OpenAI-ը շեշտում է, որ ChatGPT-ն չի փոխարինում թերապիային կամ մասնագիտական օգնությանը։

Ընկերությունն ընդգծել է նաև, որ ուժեղացրել է ChatGPT-ի պատասխանները զգայուն զրույցներում, ընդլայնել ճգնաժամային ռեսուրսների հասանելիությունը և ավելացրել Trusted Contact-ը։ Նրա գնահատմամբ՝ ոչ մի չափանիշ չի ընդգրկում այն ամենը, ինչ կարևոր է անձնական զրույցում, սակայն MentalHealthBench-ը նպատակ ունի բարձրացնել ստանդարտը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։