← უკან დაბრუნება
SiTech Team⏱️ 4 წთ. საკითხავი

AI ჩატბოტები რენტგენის სურათებს კითხულობენ — საშიშად თავდაჯერებულები შეცდომის დროსაც

AI ჩატბოტები რენტგენის სურათებს კითხულობენ — საშიშად თავდაჯერებულები შეცდომის დროსაც

RadLE 2.0 კვლევამ აჩვენა, რომ AI მოდელები რენტგენის სურათების ანალიზისას საშიშად თავდაჯერებულები არიან — Claude Fable 5-იც კი 758/2000 ქულას აღწევს, როცა ადამიანი რადიოლოგები 988.7-ს.

RadLE 2.0 — რადიოლოგიის უკანასკნელი გამოცდა AI-სთვის

2026 წლის ივლისში CRASH Lab-მა (Ashoka University, ინდოეთი) გამოაქვეყნა RadLE 2.0 — რადიოლოგიის უკანასკნელი გამოცდის მეორე ვერსია. ეს არის ბენჩმარკი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს ამოიცნოს, როდის ჯობია დიაგნოზი ადამიანს მიანდოს. საუბარია არა მხოლოდ სიზუსტეზე, არამედ იმაზეც, აქვს თუ არა მოდელს საკუთარი ლიმიტების შეგრძნება — რაც მედიცინაში გადამწყვეტი მნიშვნელობისაა.

ტესტირება ჩატარდა 200 კლინიკურ შემთხვევაზე 16 სხვადასხვა AI მოდელის მონაწილეობით, რომლებიც შეადარეს რადიოლოგთა ჯგუფს. ქულების მაქსიმუმი 2000-ია. ადამიანმა ექსპერტებმა 988.7 ქულა დააგროვეს, ხოლო საუკეთესო AI მოდელმა — 758. ეს ნიშნავს, რომ AI-ს საუკეთესო წარმომადგენელიც კი ვერ აღწევს ადამიანის მიერ ნაჩვენები შედეგის 75%-საც კი.

ეს შედეგი ნათლად აჩვენებს, რომ მიუხედავად ყველა პროგრესისა, AI ჯერ კიდევ შორს არის რადიოლოგიური დიაგნოსტიკის დამოუკიდებლად წარმოებისგან. უარესი, მოდელებს ხშირად არ აქვთ იმის გაცნობიერება, როდის უშვებენ შეცდომას. RadLE 2.0-ის პირველი ვერსია 2025 წლის სექტემბერში გამოვიდა და კიდევ უფრო მკვეთრ სურათს აჩვენებდა: რადიოლოგების სიზუსტე 83% იყო, ხოლო საუკეთესო AI-მ მხოლოდ 30% აჩვენა. სულ სამ თვეში Gemini 3 Pro-მ უკვე გადააჭარბა რეზიდენტ რადიოლოგების დონეს — სიზუსტე სწრაფად იზრდება, მაგრამ მოდელებს ჯერ კიდევ არ გააჩნიათ საკუთარი ლიმიტების შეგრძნება.

როგორ მუშაობს ქულების სისტემა — პატიოსნება ჯობს თავდაჯერებულ შეცდომას

RadLE 2.0-ის ქულების სისტემა რადიკალურად განსხვავდება ტრადიციული ბენჩმარკებისგან. ის აჯილდოვებს პატიოსნებას და სჯის ზედმეტ თავდაჯერებულობას. მოდელმა უნდა შეაფასოს თავისი პასუხი ნდობის სკალაზე 0-დან 4-მდე. თუ მოდელი სწორ პასუხს მაღალი ნდობით გასცემს — იღებს სრულ ქულებს. თუ შეცდომას უშვებს მაღალი ნდობით — ქულები ეკარგება. "არ ვიცი"-ს პასუხი 0 ქულას იძლევა, მაგრამ არანაირი ჯარიმა არ მოჰყვება. ეს ნიშნავს, რომ მოდელისთვის ყველაზე უსაფრთხო სტრატეგია გაურკვევლობის დროს გაჩუმებაა.

ეს მიდგომა განსაკუთრებით მნიშვნელოვანია მედიცინაში. როგორც ერთ-ერთ ციტირებულ კვლევაშია ნათქვამი: სანამ ბენჩმარკები მხოლოდ სიზუსტეს აფასებენ, AI მოდელები გამოცნობას სწავლობენ. მედიცინაში კი თავდაჯერებული მცდარი დიაგნოზი გაცილებით საშიშია, ვიდრე პატიოსანი აღიარება "არ ვიცი". კვლევის ავტორები ხაზგასმით აღნიშნავენ, რომ ტექნოლოგიური კომპანიების ხელმძღვანელები და ინვესტორები საჯაროდ აზვიადებენ AI-ს შესაძლებლობებს, რაც პაციენტებს შეცდომაში შეჰყავს.

მოდელი, რომელიც ხშირად გამოცნობს მაღალი ნდობით, რეიტინგში ეცემა, თუნდაც მისი ნედლი სიზუსტე დასაშვები იყოს. სწორედ ეს ხდის ზოგიერთ მოდელს საშიშს პაციენტებისთვის — მოდელი შეიძლება სტატისტიკურად კარგად გამოიყურებოდეს, მაგრამ მისი შეცდომები მაღალი ნდობით არის შეფერილი, რასაც პაციენტი ვერ ამოიცნობს.

ვინ გამოდგა საუკეთესო — Claude Fable 5, Gemini 3 Pro თუ Muse Spark 1.1?

არცერთმა მოდელმა ვერ მოიგო ყველა კატეგორიაში. Anthropic-ის Claude Fable 5 გამოვიდა საუკეთესოდ საიმედო და უსაფრთხო პასუხების მხრივ, ლიდერობდა პირველად მეტრიკაში. Google-ის Gemini 3 Pro-მ აჩვენა ყველაზე მაღალი ნედლი სიზუსტე — ფრონტიერ მოდელებს შორის ის თითქმის ეწევა ადამიანების შედეგებს.

Meta-ს Muse Spark 1.1 გამოირჩა იმით, რომ საუკეთესოდ ამოიცნობდა, როდის უნდა გადაეცა შემთხვევა ადამიანისთვის. Meta-მ ამ მოდელის ჰალუცინაციების მაჩვენებელი თითქმის გაანახევრა — ის უფრო ხშირად ამბობს უარს პასუხზე, ვიდრე არასწორ პასუხს გასცემს.

სხვა მოდელები საპირისპირო მიმართულებით ვითარდებიან. Grok 4.5, მაგალითად, მნიშვნელოვნად მეტ ჰალუცინაციას გამოიმუშავებს, ვიდრე მისი წინამორბედი. მიზეზი მარტივია: მან მეტი იცის, მაგრამ უფრო მეტადაც არის დარწმუნებული თავის შეცდომებში.

ღია მოდელების პრობლემა — ყველაფრის გამოცნობის მცდელობა

კვლევამ გამოავლინა განსაკუთრებით შემაშფოთებელი ტენდენცია ღია წონის მოდელებსა და მედიცინისთვის სპეციალურად გაწვრთნილ მოდელებში. ისინი ცდილობენ უპასუხონ თითქმის ყველა შემთხვევას, ხშირად მაღალი ნდობით, და უმეტესად ცდებიან.

"რამდენიმე მოდელს გაცილებით უკეთესი ქულა ექნებოდა, თუ უფრო ხშირად გაჩუმდებოდნენ გამოცნობის ნაცვლად", — აღნიშნავენ მკვლევრები. ეს განსაკუთრებით საშიშია იმ კონტექსტში, რომ უკვე დღეს პაციენტები ატვირთავენ რენტგენისა და MRI-ს სურათებს ჩატბოტებში და ენდობიან მათ პასუხებს.

პაციენტები უკვე ენდობიან AI-ს — და ეს სახიფათოა

სულ უფრო მეტი ადამიანი იყენებს AI ჩატბოტებს სამედიცინო რჩევისთვის. npj Digital Medicine-ში გამოქვეყნებულმა კვლევამ აჩვენა, რომ ფართოდ გავრცელებული ჩატბოტები ხშირად არასანდო პასუხებს იძლევიან სამედიცინო კითხვებზე.

კვლევის ჯგუფი აკრიტიკებს ტექნოლოგიური კომპანიების ხელმძღვანელებსა და ინვესტორებს, რომლებიც საჯაროდ აზვიადებენ AI-ს შესაძლებლობებს. განცხადებები, რომ AI უკვე უკეთ სვამს დიაგნოზს, ვიდრე ექიმების 99%, უმეტესად ანეკდოტებს ან სიმულაციებს ემყარება.

2025 წლის პოლონურმა კვლევამ კიდევ ერთი პრობლემა გამოავლინა — "Google Maps ეფექტი". ექიმები, რომლებიც რეგულარულად იყენებენ AI-ს კოლონოსკოპიის დროს, მნიშვნელოვნად ნაკლებ კიბოსწინარე წარმონაქმნებს აღმოაჩენენ AI-ს გარეშე — დეტექციის მაჩვენებელი 28.4%-დან 22.4%-მდე ეცემა. ნავიგაციის გარეშე იკარგებიან.

რადიოლოგიის AI ჰაიპი — 2016-დან 2026-მდე

რადიოლოგიამ AI-ს ჰაიპის ციკლი უკვე გაიარა. 2016 წელს AI-ს მკვლევარმა ჯეფრი ჰინტონმა განაცხადა, რომ რადიოლოგების მომზადება უნდა შეწყვეტილიყო, რადგან ღრმა სწავლება მათ სამსახურს მალე წაართმევდა. მას რიჩარდ სატონიც დაეთანხმა. თითქმის ათი წლის შემდეგ რადიოლოგები კვლავ გადატვირთულები არიან, ჰინტონს კი თავისი პროგნოზის უკან დახევა მოუწია.

მან პროფესია მხოლოდ გამოსახულების ანალიზამდე დაიყვანა და მთელი დარგის სირთულე ვერ გაითვალისწინა. OpenAI-ს CEO სემ ალტმანიც წლების განმავლობაში პროგნოზირებდა, რომ AI სამუშაო ადგილებს საშინელი ტემპით ჩაანაცვლებდა, თუმცა ცოტა ხნის წინ თავადვე გადაიფიქრა.

დასკვნა — AI-მ ჯერ უნდა ისწავლოს ჩუმად ყოფნა

RadLE 2.0-ის ავტორები მკაფიოდ აცხადებენ: სანამ AI მიიღებს დამოუკიდებელ გადაწყვეტილებებს მედიცინაში, მან უნდა იცოდეს, როდის ჯობია არ გააკეთოს ეს. ბოლო თვეების კვლევები — MIRA (ელექტრონული სამედიცინო ჩანაწერების სისტემა) და AMIE — აჩვენებენ, რომ AI-ს შეუძლია ექიმებთან კონკურენცია სიმულირებულ კონსულტაციებში, მაგრამ რეალური სამყარო გაცილებით რთულია.

AI-ს სპეციალისტებმა შეიძლება კარგად იცოდნენ თავიანთი მოდელები, მაგრამ ისინი სისტემატურად აფასებენ იმის ტემპს, თუ რამდენად სწრაფად შეიძლება მთელი პროფესიების ჩანაცვლება. როგორც მათივე AI-ს, ადამიანებმაც ყოველთვის არ იციან, როდის ჯობს გაჩუმდნენ, რადგან საკუთარი კომპეტენციის საზღვრებს გარეთ არიან.

RadLE 2.0 გაფართოვდება ახალი მოდელების ჩასართავად. სრული სამეცნიერო პუბლიკაცია ხარჯების ანალიზითა და შეცდომების კლასიფიკაციით უახლოეს მომავალში გამოქვეყნდება.

📖 წყარო