Назад
SiTech Team⏱️ 5 წთ. საკითხავი

AI-чатботи читають рентгенівські знімки — небезпечно впевнені навіть коли помиляються

AI-чатботи читають рентгенівські знімки — небезпечно впевнені навіть коли помиляються

Бенчмарк RadLE 2.0 показує, що AI-моделі, які читають рентгенівські знімки, небезпечно самовпевнені в помилках — навіть Claude Fable 5 набрав лише 758/2000 балів проти 988.7 у лікарів-радіологів.

RadLE 2.0 — останній іспит радіології для AI

У липні 2026 року CRASH Lab (Університет Ашока, Індія) опублікувала RadLE 2.0 — другу версію останнього іспиту радіології. Це бенчмарк, який перевіряє, чи здатний AI визначити, коли краще довірити діагноз людині. Йдеться не лише про точність, а й про те, чи усвідомлює модель власні обмеження — що є критично важливим у медицині.

Тестування провели на 200 клінічних випадках за участю 16 різних AI-моделей, які порівняли з групою радіологів. Максимальна кількість балів — 2000. Люди-експерти набрали 988,7 балів, а найкраща AI-модель — 758. Це означає, що навіть найкращий представник AI не досягає 75% результату, показаного людиною.

Цей результат чітко демонструє, що, попри весь прогрес, AI все ще далекий від самостійного проведення радіологічної діагностики. Ще гірше — моделі часто не усвідомлюють, коли припускаються помилки. Перша версія RadLE 2.0 вийшла у вересні 2025 року і показувала ще більш різку картину: точність радіологів становила 83%, тоді як найкращий AI показав лише 30%. Всього за три місяці Gemini 3 Pro вже перевершив рівень лікарів-інтернів — точність швидко зростає, але моделям досі бракує відчуття власних меж.

Як працює система балів — чесність краща за самовпевнену помилку

Система оцінювання RadLE 2.0 радикально відрізняється від традиційних бенчмарків. Вона винагороджує чесність і карає надмірну самовпевненість. Модель має оцінити свою відповідь за шкалою впевненості від 0 до 4. Якщо модель дає правильну відповідь з високою впевненістю — отримує повні бали. Якщо припускається помилки з високою впевненістю — бали знімаються. Відповідь "Не знаю" дає 0 балів, але не тягне за собою жодного штрафу. Це означає, що найбезпечніша стратегія для моделі — мовчати в разі невпевненості.

Такий підхід особливо важливий у медицині. Як сказано в одному з цитованих досліджень: поки бенчмарки оцінюють лише точність, AI-моделі вчаться вгадувати. У медицині ж самовпевнений хибний діагноз набагато небезпечніший, ніж чесне визнання "не знаю". Автори дослідження наголошують, що керівники технологічних компаній та інвестори публічно перебільшують можливості AI, що вводить пацієнтів в оману.

Модель, яка часто вгадує з високою впевненістю, падає в рейтингу, навіть якщо її сира точність прийнятна. Саме це робить деякі моделі небезпечними для пацієнтів — модель може виглядати статистично добре, але її помилки забарвлені високою впевненістю, яку пацієнт не може розпізнати.

Хто виявився найкращим — Claude Fable 5, Gemini 3 Pro чи Muse Spark 1.1?

Жодна модель не перемогла в усіх категоріях. Claude Fable 5 від Anthropic виявився найкращим у надійних та безпечних відповідях, лідируючи в первинній метриці. Google Gemini 3 Pro показав найвищу сиру точність — серед фронтьєрних моделей він майже наздоганяє результати людини.

Meta Muse Spark 1.1 вирізнився тим, що найкраще визначав, коли слід передати випадок людині. Meta майже вдвічі зменшила рівень галюцинацій цієї моделі — вона частіше відмовляється відповідати, ніж дає неправильну відповідь.

Інші моделі розвиваються в протилежному напрямку. Grok 4.5, наприклад, генерує значно більше галюцинацій, ніж його попередник. Причина проста: він більше знає, але й більш впевнений у своїх помилках.

Проблема відкритих моделей — спроба все вгадати

Дослідження виявило особливо тривожну тенденцію серед моделей з відкритою вагою та спеціально навчених для медицини моделей. Вони намагаються відповісти майже на всі випадки, часто з високою впевненістю, і здебільшого помиляються.

«Кілька моделей отримали б значно кращі бали, якби частіше мовчали замість того, щоб вгадувати», — зазначають дослідники. Це особливо небезпечно в контексті того, що вже сьогодні пацієнти завантажують рентгенівські знімки та МРТ в чат-боти і довіряють їхнім відповідям.

Пацієнти вже довіряють AI — і це небезпечно

Все більше людей використовують AI-чатботи для медичних порад. Дослідження, опубліковане в npj Digital Medicine, показало, що широко розповсюджені чат-боти часто дають ненадійні відповіді на медичні запитання.

Дослідницька група критикує керівників технологічних компаній та інвесторів, які публічно перебільшують можливості AI. Твердження, що AI вже ставить діагнози краще за 99% лікарів, здебільшого ґрунтуються на анекдотах або симуляціях.

Польське дослідження 2025 року виявило ще одну проблему — «ефект Google Maps». Лікарі, які регулярно використовують AI під час колоноскопії, виявляють значно менше передракових утворень без інструменту — рівень виявлення падає з 28,4% до 22,4%. Без навігації вони губляться.

Цикл хайпу AI в радіології — від 2016 до 2026

Радіологія вже пройшла повний цикл хайпу AI. У 2016 році піонер AI Джеффрі Хінтон заявив, що слід припинити навчання радіологів, оскільки глибоке навчання скоро забере їхню роботу. Річард Саттон та інші відомі голоси погодилися. Майже через десять років радіологи все ще перевантажені, а Хінтону довелося відкликати свій прогноз.

Він звів професію лише до аналізу зображень і не врахував всю складність галузі. Генеральний директор OpenAI Сем Альтман також роками прогнозував, що AI замінить робочі місця з жахливою швидкістю, але нещодавно сам передумав.

Висновок — AI спочатку має навчитися мовчати

Автори RadLE 2.0 чітко заявляють: перш ніж AI прийматиме самостійні рішення в медицині, він має знати, коли краще цього не робити. Останні дослідження — MIRA (система електронних медичних записів) та AMIE — показують, що AI може конкурувати з лікарями в симульованих консультаціях, але реальний світ набагато складніший.

Фахівці з AI можуть добре знати свої моделі, але вони систематично переоцінюють темпи, з якими можна замінити цілі професії. Як і їхні AI, люди не завжди знають, коли краще мовчати, оскільки виходять за межі власної компетенції.

RadLE 2.0 буде розширюватися для включення нових моделей. Повна наукова публікація з аналізом витрат та класифікацією помилок буде опублікована найближчим часом.

📖 Джерело