חזרה →
SiTech Team⏱️ 4 წთ. საკითხავი

צ'אטבוטים של AI שקוראים צילומי רנטגן — מסוכנים ובטוחים בעצמם גם כשהם טועים

צ'אטבוטים של AI שקוראים צילומי רנטגן — מסוכנים ובטוחים בעצמם גם כשהם טועים

מדד RadLE 2.0 מגלה שמודלי AI הקוראים צילומי רנטגן בטוחים בעצמם בצורה מסוכנת כשהם טועים — אפילו Claude Fable 5 השיג רק 758/2000 נקודות לעומת 988.7 של רדיולוגים אנושיים.

RadLE 2.0 — המבחן האחרון של הרדיולוגיה לבינה מלאכותית

ביולי 2026, מעבדת CRASH (אוניברסיטת אשוקה, הודו) פרסמה את RadLE 2.0 — הגרסה השנייה של המבחן האחרון ברדיולוגיה.这是一个 בֶּנצ'מַרק שבודק האם AI יכול לזהות מתי עדיף להשאיר אבחנה לאדם. זה לא רק על דיוק, אלא על האם המודל מודע למגבלותיו שלו — דבר קריטי ברפואה.

הבדיקה נערכה על 200 מקרים קליניים בהשתתפות 16 מודלי AI שונים, שהושוו לקבוצת רדיולוגים. המקסימום הוא 2000 נקודות. המומחים האנושיים השיגו 988.7 נקודות, והמודל הטוב ביותר — 758. זה אומר שאפילו נציג ה-AI הטוב ביותר לא מגיע ל-75% מהתוצאה האנושית.

תוצאה זו מראה בבירור שלמרות כל ההתקדמות, AI עדיין רחוק מביצוע עצמאי של אבחון רדיולוגי. גרוע מכך — מודלים לעתים קרובות לא מודעים כשהם עושים טעויות. הגרסה הראשונה של RadLE 2.0 יצאה בספטמבר 2025 והראתה תמונה חריפה עוד יותר: דיוק הרדיולוגים היה 83%, בעוד שה-AI הטוב ביותר השיג רק 30%. תוך שלושה חודשים בלבד, Gemini 3 Pro כבר עלה על רמת הרדיולוגים המתמחים — הדיוק עולה במהירות, אך למודלים עדיין חסרה תחושת הגבולות שלהם.

איך עובדת מערכת הניקוד — כנות עדיפה על טעות בטוחה בעצמה

שיטת הניקוד של RadLE 2.0 שונה מהותית מבנצ'מרקים מסורתיים. היא מתגמלת כנות ומענישה ביטחון עצמי מופרז. המודל חייב לדרג את תשובתו בסולם ביטחון מ-0 עד 4. אם המודל נותן תשובה נכונה בביטחון גבוה — הוא מקבל ניקוד מלא. אם הוא טועה בביטחון גבוה — הניקוד נגרע. תשובת "לא יודע" מקבלת 0 נקודות אך ללא קנס. זה אומר שהאסטרטגיה הבטוחה ביותר עבור המודל היא לשתוק כשהוא לא בטוח.

גישה זו חשובה במיוחד ברפואה. כפי שנאמר במחקר אחד המצוטט: כל עוד בנצ'מרקים מעריכים רק דיוק, מודלי AI לומדים לנחש. ברפואה, אבחנה שגויה בטוחה בעצמה מסוכנת הרבה יותר מהודאה כנה ב"לא יודע". מחברי המחקר מדגישים שמנהלי חברות טכנולוגיה ומשקיעים מגזימים בפומבי ביכולות AI, מה שמטעה מטופלים.

מודל שמנחש לעתים קרובות בביטחון גבוה צונח בדירוג, גם אם הדיוק הגולמי שלו סביר. זה בדיוק מה שהופך מודלים מסוימים למסוכנים למטופלים — המודל עשוי להיראות סטטיסטית טוב, אבל הטעויות שלו צבועות בביטחון גבוה שהמטופל לא יכול לזהות.

מי היה הטוב ביותר — Claude Fable 5, Gemini 3 Pro או Muse Spark 1.1?

אף מודל לא ניצח בכל הקטגוריות. Claude Fable 5 של Anthropic היה הטוב ביותר בתשובות אמינות ובטוחות, והוביל במדד הראשי. Gemini 3 Pro של Google הראה את הדיוק הגולמי הגבוה ביותר — מבין מודלי החזית, הוא כמעט משיג תוצאות אנושיות.

Meta Muse Spark 1.1 התבלט בזיהוי מתי יש להעביר מקרה לרדיולוג אנושי. Meta כמעט חצתה את שיעור ההזיות של מודל זה — כעת הוא מסרב לענות לעתים קרובות יותר מאשר נותן תשובה שגויה.

מודלים אחרים מתפתחים בכיוון ההפוך. Grok 4.5, לדוגמה, מייצר יותר הזיות מקודמו. הסיבה פשוטה: הוא יודע יותר, אבל גם בטוח יותר בטעויותיו.

בעיית המודלים הפתוחים — ניסיון לנחש הכל

המחקר גילה מגמה מדאיגה במיוחד בקרב מודלים במשקל פתוח ומודלים שאומנו במיוחד לרפואה. הם מנסים לענות על כמעט כל מקרה, לעתים קרובות בביטחון גבוה, וברוב המקרים טועים.

"מספר מודלים היו מקבלים ציונים טובים יותר אילו היו שותקים לעתים קרובות יותר במקום לנחש", מציינים החוקרים. זה מסוכן במיוחד בהקשר שכבר היום מטופלים מעלים צילומי רנטגן ו-MRI לצ'אטבוטים וסומכים על תשובותיהם.

מטופלים כבר סומכים על AI — וזה מסוכן

יותר ויותר אנשים משתמשים בצ'אטבוטים של AI לייעוץ רפואי. מחקר שפורסם ב-npj Digital Medicine הראה שצ'אטבוטים נפוצים נותנים לעתים קרובות תשובות לא אמינות לשאלות רפואיות.

צוות המחקר מבקר מנהלי חברות טכנולוגיה ומשקיעים שמגזימים בפומבי ביכולות AI. טענות ש-AI כבר מאבחן טוב יותר מ-99% מהרופאים מבוססות בעיקר על אנקדוטות או סימולציות.

מחקר פולני מ-2025 גילה בעיה נוספת — "אפקט Google Maps". רופאים המשתמשים בקביעות ב-AI בזמן קולונוסקופיה מגלים פחות משמעותית נגעים טרום-סרטניים ללא הכלי — שיעור הגילוי יורד מ-28.4% ל-22.4%. ללא ניווט, הם הולכים לאיבוד.

מחזור ההייפ של AI ברדיולוגיה — מ-2016 עד 2026

רדיולוגיה כבר עברה מחזור הייפ שלם של AI. ב-2016, חלוץ AI ג'פרי הינטון הכריז שיש להפסיק להכשיר רדיולוגים כי למידה עמוקה תחליף בקרוב את עבודתם. ריצ'רד סאטון וקולות בולטים אחרים הסכימו. כמעט עשור אחר כך, רדיולוגים עדיין עמוסים, והינטון נאלץ לחזור בו מתחזיתו.

הוא צמצם את המקצוע רק לניתוח תמונות והתעלם ממורכבות התחום. מנכ"ל OpenAI סם אלטמן גם חזה במשך שנים ש-AI יחליף מקומות עבודה בקצב מפחיד, אך לאחרונה חזר בו.

מסקנה — AI חייב קודם ללמוד לשתוק

מחברי RadLE 2.0 מצהירים בבירור: לפני ש-AI יקבל החלטות עצמאיות ברפואה, הוא חייב לדעת מתי עדיף שלא לעשות זאת. מחקרים אחרונים — MIRA (מערכת רשומות רפואיות אלקטרוניות) ו-AMIE — מראים ש-AI יכול להתחרות ברופאים בייעוץ מדומה, אבל העולם האמיתי מורכב הרבה יותר.

מומחי AI עשויים להכיר היטב את המודלים שלהם, אך הם מעריכים באופן שיטתי יתר על המידה את הקצב שבו ניתן להחליף מקצועות שלמים. כמו ה-AI שהם בונים, גם אנשים לא תמיד יודעים מתי עדיף לשתוק כי הם מחוץ לתחום המומחיות שלהם.

RadLE 2.0 יורחב באופן שוטף לכלול מודלים חדשים. פרסום מדעי מלא עם ניתוח עלויות וסיווג שגיאות יפורסם בעתיד הקרוב.

📖 מקור