חזרה
OpenAI משיקה את MentalHealthBench: מדד פתוח להערכת תשובות AI בשיחות על בריאות הנפש
SiTech AI Team2 წთ. საკითხავი

OpenAI משיקה את MentalHealthBench: מדד פתוח להערכת תשובות AI בשיחות על בריאות הנפש

OpenAI הציגה את MentalHealthBench — מדד פתוח שנבנה יחד עם יותר מ-80 מומחים מוסמכים מתחום בריאות הנפש מ-22 מדינות, כדי להעריך כיצד מערכות AI מגיבות בשיחות מציאותיות.

OpenAI הציגה ב-23 בספטמבר את MentalHealthBench — מדד (benchmark) פתוח שבוחן עד כמה טוב מערכות AI מגיבות בשיחות מציאותיות על בריאות הנפש. לפי החברה, המדד נבנה יחד עם יותר מ-80 פסיכולוגים ופסיכיאטרים מוסמכים מ-22 מדינות.

יותר ממיליארד אנשים משתמשים ב-ChatGPT מדי שבוע, והם מביאים אליו יותר ויותר נושאים אישיים: מערכות יחסים, לחץ יומיומי ורגעי משבר. OpenAI מציינת שרוב ההערכות הקודמות התמקדו בתרחישי חירום, ולכן נותרה פתוחה השאלה כיצד מודלים מתנהגים במגוון הרחב של שיחות יומיומיות ופחות חריפות.

מה כולל המדד

MentalHealthBench כולל 1,215 שיחות סינתטיות שנוצרו בטכניקות שומרות פרטיות ומשקפות דפוסי שימוש אמיתיים. 53.5% מהשיחות אינן חריפות, 18.2% חריפות, ו-28.3% עוסקות במצבי חירום. מבוגרים הם 68.1% מהפרסונות, בני נוער בגילי 13–17 — 21.2%, מטפלים — 4.9% ואנשי מקצוע קליניים — 5.8%.

כל שיחה נסקרה על ידי לפחות שלושה מומחים, שניסחו קריטריונים עם משקלים שבין 10- ל-10+: נקודות חיוביות מתגמלות התנהגות מועילה, ושליליות מענישות התנהגות מזיקה. רק קריטריונים שלפחות שניים מהמומחים הסכימו עליהם ושלישי לא סתר נשארו במדד. הערכה אוטומטית, GPT-5.6 Sol, מדרגת את תשובות המודלים, והציון הכולל מתפרק לעשרה ממדי התנהגות — בהם איסוף הקשר, אמפתיה, דיוק קליני וכיול דחיפות.

OpenAI בחנה מספר מודלים במדד: GPT-6 Astra קיבל 57.3%, GPT-6 Sol — 53.9%, ו-Claude Opus 5.5 — 52.4%.

מומחים מול משתמשים

במחקר נפרד השתתפו 44 מבוגרים מ-16 מדינות, שהשתמשו ב-AI לתמיכה נפשית או רגשית. המשתתפים דירגו תשובות רק בשיחות לא חריפות, כדי לא לחשוף אותם לתוכן מטריד. המשתמשים ייחסו חשיבות רבה במיוחד לצעדים מעשיים ולהטון, בעוד המומחים הדגישו איסוף הקשר ופרשנות זהירה של מצבים דו-משמעיים. לפי החברה, נקודת המבט של המשתמשים משלימה את זו של המומחים אך אינה מחליפה אותה, והקריטריונים הסופיים נשארים מבוססי קונצנזוס מומחים.

למה זה חשוב

המדד פורסם באופן פתוח: חוקרים יכולים לבחון את המתודולוגיה, להריץ הערכות משלהם ולהמשיך לפתח את העבודה, ומפתחים אחרים יכולים למדוד את מודליהם לפי אותה רובריקה. OpenAI מדגישה ש-ChatGPT אינו תחליף לטיפול או לסיוע מקצועי.

החברה גם מסרה שחיזקה את תשובות ChatGPT בשיחות רגישות, הרחיבה את הגישה למשאבי חירום והוסיפה את Trusted Contact. לדבריה, אף מדד לא מכסה כל מה שחשוב בשיחה אישית, אך MentalHealthBench נועד לקבוע סטנדרט גבוה יותר.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.