AI զրուցաբոտերը կարդում են ռենտգենյան պատկերները — վտանգավոր ինքնավստահ նույնիսկ սխալվելիս
RadLE 2.0 չափանիշը ցույց է տալիս, որ AI մոդելները, որոնք կարդում են ռենտգենյան պատկերներ, վտանգավոր չափով չափազանց ինքնավստահ են սխալվելիս — նույնիսկ Claude Fable 5-ը վաստակեց ընդամենը 758/2000 միավոր՝ մարդ ռադիոլոգների 988.7-ի դիմաց:
RadLE 2.0 — ռադիոլոգիայի վերջին քննությունը AI-ի համար
2026 թվականի հուլիսին CRASH Lab-ը (Աշոկայի համալսարան, Հնդկաստան) հրապարակեց RadLE 2.0 — ռադիոլոգիայի վերջին քննության երկրորդ տարբերակը: Սա չափանիշ է, որը ստուգում է, թե արդյոք AI-ն կարող է ճանաչել, երբ ավելի լավ է ախտորոշումը վստահել մարդուն: Խոսքը ոչ միայն ճշգրտության մասին է, այլ նաև այն մասին, թե արդյոք մոդելը գիտակցում է սեփական սահմանները — ինչը կարևոր նշանակություն ունի բժշկության մեջ:
Թեստավորումն անցկացվեց 200 կլինիկական դեպքերի վրա՝ 16 տարբեր AI մոդելների մասնակցությամբ, որոնք համեմատեցին ռադիոլոգների խմբի հետ: Միավորների առավելագույնը 2000 է: Մարդ փորձագետները վաստակեցին 988.7 միավոր, իսկ լավագույն AI մոդելը՝ 758: Սա նշանակում է, որ նույնիսկ AI-ի լավագույն ներկայացուցիչը չի հասնում մարդու ցուցադրած արդյունքի 75%-ին:
Այս արդյունքը հստակ ցույց է տալիս, որ չնայած բոլոր առաջընթացին, AI-ն դեռ հեռու է ռադիոլոգիական ախտորոշման ինքնուրույն իրականացումից: Ավելի վատ, մոդելները հաճախ չեն գիտակցում, երբ սխալվում են: RadLE 2.0-ի առաջին տարբերակը թողարկվեց 2025 թվականի սեպտեմբերին և ցույց էր տալիս ավելի կտրուկ պատկեր. ռադիոլոգների ճշգրտությունը 83% էր, իսկ լավագույն AI-ն ցույց տվեց ընդամենը 30%: Ընդամենը երեք ամսում Gemini 3 Pro-ն արդեն գերազանցեց ռեզիդենտ ռադիոլոգների մակարդակը — ճշգրտությունն արագ աճում է, բայց մոդելներին դեռ պակասում է սեփական սահմանների զգացումը:
Ինչպես է աշխատում միավորների համակարգը — ազնվությունն ավելի լավ է, քան ինքնավստահ սխալը
RadLE 2.0-ի գնահատման համակարգը արմատապես տարբերվում է ավանդական չափանիշներից: Այն պարգևատրում է ազնվությունը և պատժում է չափազանց ինքնավստահությունը: Մոդելը պետք է գնահատի իր պատասխանը վստահության սանդղակով 0-ից 4-ը: Եթե մոդելը ճիշտ պատասխան է տալիս բարձր վստահությամբ — ստանում է լրիվ միավորներ: Եթե սխալվում է բարձր վստահությամբ — միավորները կորչում են: «Չգիտեմ» պատասխանը տալիս է 0 միավոր, բայց ոչ մի տուգանք չի հետևում: Սա նշանակում է, որ մոդելի համար ամենաանվտանգ ռազմավարությունը անորոշության դեպքում լռելն է:
Այս մոտեցումը հատկապես կարևոր է բժշկության մեջ: Ինչպես ասված է մեջբերված հետազոտություններից մեկում. քանի դեռ չափանիշները գնահատում են միայն ճշգրտությունը, AI մոդելները սովորում են գուշակել: Բժշկության մեջ ինքնավստահ սխալ ախտորոշումը շատ ավելի վտանգավոր է, քան ազնիվ «չգիտեմ» խոստովանությունը: Հետազոտության հեղինակները շեշտում են, որ տեխնոլոգիական ընկերությունների ղեկավարներն ու ներդրողները հրապարակավ չափազանցնում են AI-ի հնարավորությունները, ինչը մոլորության մեջ է գցում հիվանդներին:
Մոդելը, որը հաճախ գուշակում է բարձր վստահությամբ, ընկնում է վարկանիշում, նույնիսկ եթե նրա հում ճշգրտությունը ընդունելի է: Հենց դա է որոշ մոդելներ վտանգավոր դարձնում հիվանդների համար — մոդելը կարող է վիճակագրորեն լավ տեսք ունենալ, բայց նրա սխալները ներկված են բարձր վստահությամբ, ինչը հիվանդը չի կարող ճանաչել:
Ո՞վ էր լավագույնը — Claude Fable 5, Gemini 3 Pro թե Muse Spark 1.1:
Ոչ մի մոդել չհաղթեց բոլոր կատեգորիաներում: Anthropic-ի Claude Fable 5-ը լավագույնն էր հուսալի և անվտանգ պատասխաններով՝ առաջատար լինելով առաջնային ցուցանիշում: Google-ի Gemini 3 Pro-ն ցույց տվեց ամենաբարձր հում ճշգրտությունը — մոդելների շարքում այն գրեթե հասնում է մարդկային արդյունքներին:
Meta-ի Muse Spark 1.1-ն աչքի ընկավ նրանով, որ լավագույնս ճանաչում էր, երբ պետք է դեպքը փոխանցել մարդ ռադիոլոգին: Meta-ն գրեթե կիսով չափ կրճատեց այս մոդելի հալյուցինացիաների մակարդակը — այն այժմ ավելի հաճախ հրաժարվում է պատասխանել, քան սխալ պատասխան տալիս:
Այլ մոդելներ զարգանում են հակառակ ուղղությամբ: Grok 4.5-ը, օրինակ, զգալիորեն ավելի շատ հալյուցինացիաներ է արտադրում, քան իր նախորդը: Պատճառը պարզ է. այն ավելի շատ գիտի, բայց նաև ավելի վստահ է իր սխալների մեջ:
Բաց մոդելների խնդիրը — ամեն ինչ գուշակելու փորձ
Հետազոտությունը բացահայտեց հատկապես մտահոգիչ միտում բաց կշիռներով մոդելների և բժշկության համար հատուկ վերապատրաստված մոդելների շրջանում: Նրանք փորձում են պատասխանել գրեթե բոլոր դեպքերին, հաճախ բարձր վստահությամբ, և շատ դեպքերում սխալվում են:
«Մի քանի մոդելներ շատ ավելի լավ միավորներ կունենային, եթե ավելի հաճախ լռեին գուշակելու փոխարեն», — նշում են հետազոտողները: Սա հատկապես վտանգավոր է այն համատեքստում, որ արդեն այսօր հիվանդները վերբեռնում են ռենտգենյան և MRI պատկերները զրուցաբոտերում և վստահում նրանց պատասխաններին:
Հիվանդներն արդեն վստահում են AI-ին — և դա վտանգավոր է
Ավելի ու ավելի շատ մարդիկ օգտագործում են AI զրուցաբոտերը բժշկական խորհրդատվության համար: npj Digital Medicine-ում հրապարակված հետազոտությունը ցույց տվեց, որ լայնորեն տարածված զրուցաբոտերը հաճախ անվստահելի պատասխաններ են տալիս բժշկական հարցերին:
Հետազոտական խումբը քննադատում է տեխնոլոգիական ընկերությունների ղեկավարներին և ներդրողներին, ովքեր հրապարակավ չափազանցնում են AI-ի հնարավորությունները: Պնդումները, որ AI-ն արդեն ավելի լավ է ախտորոշում, քան բժիշկների 99%-ը, հիմնականում հիմնված են անեկդոտների կամ սիմուլյացիաների վրա:
2025 թվականի լեհական հետազոտությունը բացահայտեց մեկ այլ խնդիր՝ «Google Maps էֆեկտը»: Բժիշկները, ովքեր պարբերաբար օգտագործում են AI-ն կոլոնոսկոպիայի ժամանակ, զգալիորեն ավելի քիչ նախաքաղցկեղային գոյացություններ են հայտնաբերում առանց գործիքի — հայտնաբերման մակարդակն ընկնում է 28.4%-ից մինչև 22.4%: Առանց նավիգացիայի նրանք կորչում են:
Ռադիոլոգիայի AI հիփի ցիկլը — 2016-ից մինչև 2026
Ռադիոլոգիան արդեն անցել է AI-ի հիփի ամբողջական ցիկլը: 2016 թվականին AI ռահվիրա Ջեֆրի Հինթոնը հայտարարեց, որ ռադիոլոգների պատրաստումը պետք է դադարեցվի, քանի որ խորը ուսուցումը շուտով կվերցնի նրանց աշխատանքը: Ռիչարդ Սաթոնը և այլ նշանավոր ձայներ համաձայնեցին: Գրեթե տասը տարի անց ռադիոլոգները դեռ գերծանրաբեռնված են, և Հինթոնը ստիպված եղավ հետ վերցնել իր կանխատեսումը:
Նա մասնագիտությունը հասցրեց միայն պատկերների վերլուծության և չհաշվի առավ ոլորտի ամբողջ բարդությունը: OpenAI-ի գործադիր տնօրեն Սեմ Ալթմանը նույնպես տարիներ շարունակ կանխատեսում էր, որ AI-ն աշխատատեղերը կփոխարինի սարսափելի տեմպերով, սակայն վերջերս ինքը փոխեց իր կարծիքը:
Եզրակացություն — AI-ն նախ պետք է սովորի լռել
RadLE 2.0-ի հեղինակները հստակ հայտարարում են. մինչ AI-ն ինքնուրույն որոշումներ կկայացնի բժշկության մեջ, այն պետք է իմանա, երբ ավելի լավ է դա չանել: Վերջին ամիսների հետազոտությունները — MIRA (էլեկտրոնային բժշկական գրառումների համակարգ) և AMIE — ցույց են տալիս, որ AI-ն կարող է մրցակցել բժիշկների հետ սիմուլյացված խորհրդատվություններում, բայց իրական աշխարհը շատ ավելի բարդ է:
AI մասնագետները կարող են լավ ճանաչել իրենց մոդելները, բայց նրանք համակարգված գերագնահատում են այն տեմպը, որով կարող են փոխարինվել ամբողջ մասնագիտությունները: Ինչպես իրենց կառուցած AI-ն, մարդիկ նույնպես միշտ չգիտեն, երբ ավելի լավ է լռել, քանի որ դուրս են գալիս սեփական իրավասության սահմաններից:
RadLE 2.0-ը կընդլայնվի նոր մոդելներ ներառելու համար: Ամբողջական գիտական հրապարակումը ծախսերի վերլուծությամբ և սխալների դասակարգմամբ կհրապարակվի մոտ ապագայում: