უკან დაბრუნება
OpenAI-მა MentalHealthBench გამოუშვა — ღია ბენჩმარკი ფსიქიკური ჯანმრთელობის საუბრებში AI-ის პასუხებისთვის
SiTech AI Team2 წთ. საკითხავი

OpenAI-მა MentalHealthBench გამოუშვა — ღია ბენჩმარკი ფსიქიკური ჯანმრთელობის საუბრებში AI-ის პასუხებისთვის

OpenAI-მა MentalHealthBench წარადგინა — ღია ბენჩმარკი, რომელიც AI-ის პასუხებს ფსიქიკური ჯანმრთელობის რეალისტურ საუბრებში აფასებს. ის 22 ქვეყნის 80-ზე მეტ ლიცენზირებულ ფსიქოლოგსა და ფსიქიატრთან ერთად შეიქმნა.

OpenAI-მა 23 სექტემბერს წარადგინა MentalHealthBench — ღია ბენჩმარკი, რომელიც ზომავს, რამდენად კარგად პასუხობენ AI სისტემები ფსიქიკური ჯანმრთელობის რეალისტურ საუბრებში. კომპანიის განცხადებით, ბენჩმარკი 22 ქვეყნის 80-ზე მეტ ლიცენზირებულ ფსიქოლოგსა და ფსიქიატრთან ერთად შეიქმნა.

ChatGPT-ს ყოველკვირეულად მილიარდზე მეტი ადამიანი იყენებს და მომხმარებლები მას სულ უფრო პირად თემებზეც ესაუბრებიან — ურთიერთობებზე, ყოველდღიურ სტრესსა და კრიზისულ მომენტებზე. OpenAI-ის თქმით, აქამდე არსებული შეფასებები ძირითადად გადაუდებელ სცენარებზე იყო ორიენტირებული, ამიტომ ღია რჩებოდა კითხვა, როგორ მუშაობს მოდელი ყოველდღიურ, ნაკლებად მწვავე საუბრებში.

რას მოიცავს ბენჩმარკი

MentalHealthBench მოიცავს 1 215 სინთეტიკურ საუბარს, რომლებიც კონფიდენციალურობის დამცავი ტექნიკით, რეალური გამოყენების ნიმუშების მიხედვით შეიქმნა. საუბრების 53,5% არამწვავე თემებს ეხება, 18,2% მაღალი სიმწვავის, 28,3% კი გადაუდებელ სიტუაციებს. მომხმარებლის როლიდან ყველაზე ხშირი ზრდასრულია (68,1%); მოზარდები, 13–17 წლის, საუბრების 21,2%-ს შეადგენენ, მზრუნველები — 4,9%-ს, კლინიკოსები — 5,8%-ს.

თითოეული საუბარი მინიმუმ სამმა ექსპერტმა გადაამოწმა. მათ შეადგინეს შეფასების კრიტერიუმები, რომელთა წონაც −10-დან +10-მდე მერყეობს: დადებითი ქულები სასარგებლო ქცევას აჯილდოებს, უარყოფითი — მავნეს სჯის. რუბრიკაში მხოლოდ ის კრიტერიუმები შევიდა, რომლებსაც ორი ექსპერტი მაინც დაეთანხმა და მესამემ არ უარყო.

მოდელების პასუხებს ავტომატური შემფასებელი GPT-5.6 Sol აფასებს. საერთო ქულა ათ განზომილებად იშლება — მათ შორის კონტექსტის გამოკითხვა, ემპათია, კლინიკური სიზუსტე და სიმწვავის შეფასება. OpenAI-ის დაკვირვებით, რაც უფრო თანამედროვეა მოდელი, მით უკეთ ამოიცნობს, როდის სჭირდება საუბარს დამატებითი კონტექსტი. ბენჩმარკზე რამდენიმე მოდელი შემოწმდა: GPT-6 Astra-მ 57,3% დააფიქსირა, GPT-6 Sol-მა — 53,9%, Claude Opus 5.5-მა — 52,4%.

ექსპერტებისა და მომხმარებლების შედარება

MentalHealthBench-ის გვერდით OpenAI-მ ცალკე კვლევაც ჩაატარა: 16 ქვეყნის 44 ზრდასრულმა, რომლებსაც AI ფსიქიკური ან ემოციური მხარდაჭერისთვის გამოუყენებიათ, მოდელების პასუხები შეაფასა. მხოლოდ არამწვავე საუბრები შეირჩა, რომ მონაწილეები მძიმე მასალის ზემოქმედებისგან დაეცვა. მომხმარებლებისთვის განსაკუთრებით მნიშვნელოვანი პრაქტიკული ნაბიჯები და ტონი აღმოჩნდა, ექსპერტებისთვის — კონტექსტის შეგროვება და ორაზროვანი სიტუაციის ფრთხილი გააზრება. კომპანია აღნიშნავს, რომ მომხმარებლის შეხედულება ექსპერტულს არ ცვლის, არამედ ავსებს; საბოლოო კრიტერიუმები მაინც ექსპერტთა კონსენსუსს ეყრდნობა.

რატომ აქვს მნიშვნელობა

ბენჩმარკი ღიად გამოქვეყნდა: მკვლევრებს შეუძლიათ შეისწავლონ მეთოდოლოგია, ჩაატარონ საკუთარი შეფასებები და ამ მუშაობას დაეყრდნონ. ეს სხვა კომპანიებსაც აძლევს საშუალებას, საკუთარი მოდელები იმავე რუბრიკით გაზომონ და შედეგები შეადარონ. OpenAI ხაზგასმით აღნიშნავს, რომ ChatGPT თერაპიას ან პროფესიონალურ დახმარებას ვერ ჩაანაცვლებს.

კომპანიამ ასევე გააძლიერა ChatGPT-ის პასუხები მგრძნობიარე საუბრებში, გააფართოვა კრიზისულ რესურსებზე წვდომა და წარადგინა Trusted Contact. მისივე შეფასებით, ვერც ერთი ბენჩმარკი ვერ მოიცავს ყველაფერს, რაც პირად საუბარში მნიშვნელოვანია, თუმცა MentalHealthBench უფრო მაღალი სტანდარტის დამკვიდრებას ისახავს მიზნად.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.