Geri Dön
SiTech Team⏱️ 5 წთ. საკითხავი

Yapay Zeka Sohbet Robotları Röntgen Görüntülerini Okuyor — Hatalı Olduklarında Bile Tehlikeli Derecede Kendinden Emin

Yapay Zeka Sohbet Robotları Röntgen Görüntülerini Okuyor — Hatalı Olduklarında Bile Tehlikeli Derecede Kendinden Emin

RadLE 2.0 kıyaslaması, röntgen görüntülerini okuyan yapay zeka modellerinin hata yaptıklarında tehlikeli derecede aşırı güvenli olduğunu gösteriyor — Claude Fable 5 bile insan radyologların 988.7'sine karşı yalnızca 758/2000 puan alabildi.

RadLE 2.0 — Radyolojinin Yapay Zeka İçin Son Sınavı

Temmuz 2026'da CRASH Laboratuvarı (Ashoka Üniversitesi, Hindistan), RadLE 2.0'ı yayınladı — Radyolojinin Son Sınavı'nın ikinci versiyonu. Bu kıyaslama, yapay zekanın bir tanıyı ne zaman bir insan uzmana bırakması gerektiğini anlayıp anlayamadığını test ediyor. Mesele sadece doğruluk değil, modelin kendi sınırlarının farkında olup olmadığı — tıpta kritik öneme sahip bir konu.

Test, 200 klinik vaka üzerinde 16 farklı yapay zeka modeliyle gerçekleştirildi ve sonuçlar bir grup radyologla karşılaştırıldı. Maksimum puan 2000. İnsan uzmanlar 988.7 puan alırken, en iyi yapay zeka modeli 758 puan aldı. Bu, en iyi yapay zeka temsilcisinin bile insan sonucunun %75'ine ulaşamadığı anlamına geliyor.

Bu sonuç, tüm ilerlemeye rağmen yapay zekanın bağımsız radyolojik teşhisten hâlâ çok uzak olduğunu açıkça gösteriyor. Daha da kötüsü, modeller çoğu zaman hata yaptıklarının farkında değiller. RadLE 2.0'ın ilk versiyonu Eylül 2025'te yayınlanmıştı ve daha da çarpıcı bir tablo çiziyordu: radyologların doğruluğu %83 iken, en iyi yapay zeka yalnızca %30 göstermişti. Sadece üç ay içinde Gemini 3 Pro, asistan radyologların seviyesini geçti — doğruluk hızla artıyor, ancak modeller hâlâ kendi sınırlarının farkında değil.

Puan Sistemi Nasıl Çalışıyor — Dürüstlük, Kendinden Emin Hatadan Daha İyidir

RadLE 2.0'ın puanlama sistemi geleneksel kıyaslamalardan radikal şekilde farklıdır. Dürüstlüğü ödüllendirir ve aşırı güveni cezalandırır. Model, yanıtını 0'dan 4'e kadar bir güven ölçeğinde değerlendirmelidir. Model yüksek güvenle doğru cevap verirse tam puan alır. Yüksek güvenle hata yaparsa puan kaybeder. "Bilmiyorum" yanıtı 0 puan alır ancak ceza getirmez — bu, emin olunmadığında en güvenli seçenektir.

Bu yaklaşım tıpta özellikle önemlidir. Alıntı yapılan bir araştırmada belirtildiği gibi: Kıyaslamalar yalnızca doğruluğu değerlendirdiği sürece, yapay zeka modelleri tahmin etmeyi öğrenir. Tıpta ise kendinden emin yanlış teşhis, dürüst bir "bilmiyorum" itirafından çok daha tehlikelidir. Araştırmanın yazarları, teknoloji şirketi yöneticilerinin ve yatırımcıların yapay zekanın yeteneklerini abarttığını ve bunun hastaları yanılttığını vurguluyor.

Sık sık yüksek güvenle tahmin eden bir model, ham doğruluğu kabul edilebilir olsa bile sıralamada düşer. İşte bu, bazı modelleri hastalar için tehlikeli yapan şeydir — model istatistiksel olarak iyi görünebilir, ancak hataları hastanın fark edemeyeceği yüksek güvenle renklendirilmiştir.

En İyisi Kim Oldu — Claude Fable 5, Gemini 3 Pro mu yoksa Muse Spark 1.1 mi?

Hiçbir model tüm kategorilerde kazanamadı. Anthropic'in Claude Fable 5'i güvenilir ve emniyetli yanıtlarda en iyisi oldu ve birincil metrikte liderlik etti. Google'ın Gemini 3 Pro'su en yüksek ham doğruluğu gösterdi — öncü modeller arasında neredeyse insan sonuçlarına yetişiyor.

Meta'nın Muse Spark 1.1'i, bir vakayı ne zaman insan radyoloğa devredeceğini en iyi belirlemesiyle öne çıktı. Meta, bu modelin halüsinasyon oranını neredeyse yarıya indirdi — artık yanlış cevap vermektense cevap vermeyi daha sık reddediyor.

Diğer modeller ters yönde gelişiyor. Örneğin Grok 4.5, selefinden önemli ölçüde daha fazla halüsinasyon üretiyor. Nedeni basit: daha çok şey biliyor, ancak hatalarına da daha çok inanıyor.

Açık Modellerin Sorunu — Her Şeyi Tahmin Etme Çabası

Araştırma, açık ağırlıklı modeller ve tıp için özel olarak eğitilmiş modeller arasında özellikle endişe verici bir eğilim ortaya çıkardı. Neredeyse her vakaya, çoğunlukla yüksek güvenle yanıt vermeye çalışıyorlar ve çoğu zaman yanılıyorlar.

"Birkaç model, tahmin etmek yerine daha sık sessiz kalsalardı çok daha iyi puan alırdı," diye belirtiyor araştırmacılar. Bu, hastaların zaten röntgen ve MRI görüntülerini sohbet robotlarına yükleyip yanıtlarına güvendiği bir bağlamda özellikle tehlikeli.

Hastalar Zaten Yapay Zekaya Güveniyor — ve Bu Tehlikeli

Giderek daha fazla insan tıbbi tavsiye için yapay zeka sohbet robotlarını kullanıyor. npj Digital Medicine'de yayınlanan bir araştırma, yaygın olarak kullanılan sohbet robotlarının tıbbi sorulara sık sık güvenilmez yanıtlar verdiğini gösterdi.

Araştırma ekibi, teknoloji şirketi yöneticilerini ve yatırımcıları, yapay zekanın yeteneklerini kamuoyunda abarttıkları için eleştiriyor. Yapay zekanın zaten doktorların %99'undan daha iyi teşhis koyduğu iddiaları çoğunlukla anekdotlara veya simülasyonlara dayanıyor.

2025 Polonya araştırması başka bir sorunu ortaya çıkardı — "Google Maps etkisi". Kolonoskopi sırasında düzenli olarak yapay zeka kullanan doktorlar, araç olmadan çalışırken önemli ölçüde daha az kanser öncesi oluşum tespit ediyor — tespit oranı %28.4'ten %22.4'e düşüyor. Navigasyon olmadan kayboluyorlar.

Radyolojide Yapay Zeka Heyecanı Döngüsü — 2016'dan 2026'ya

Radyoloji, yapay zeka heyecanı döngüsünü çoktan tamamladı. 2016'da yapay zeka öncüsü Geoffrey Hinton, radyolog yetiştirmenin durdurulması gerektiğini çünkü derin öğrenmenin yakında işlerini ellerinden alacağını açıkladı. Richard Sutton ve diğer önde gelen isimler de aynı fikirdeydi. Neredeyse on yıl sonra radyologlar hâlâ aşırı iş yükü altında ve Hinton tahminini geri çekmek zorunda kaldı.

Mesleği yalnızca görüntü analizine indirgemiş ve alanın tüm karmaşıklığını göz ardı etmişti. OpenAI CEO'su Sam Altman da yıllarca yapay zekanın işleri korkunç bir hızla değiştireceğini tahmin etti, ancak yakın zamanda kendisi fikrini değiştirdi.

Sonuç — Yapay Zeka Önce Sessiz Kalmayı Öğrenmeli

RadLE 2.0 yazarları açıkça belirtiyor: Yapay zeka tıpta bağımsız kararlar almadan önce, bunu yapmamanın ne zaman daha iyi olduğunu bilmelidir. Son ayların araştırmaları — MIRA (elektronik tıbbi kayıt sistemi) ve AMIE — yapay zekanın simüle konsültasyonlarda doktorlarla rekabet edebileceğini ancak gerçek dünyanın çok daha karmaşık olduğunu gösteriyor.

Yapay zeka uzmanları modellerini iyi tanıyabilir, ancak tüm mesleklerin ne kadar hızlı değiştirilebileceğini sistematik olarak abartıyorlar. İnşa ettikleri yapay zeka gibi, insanlar da kendi uzmanlık alanlarının dışına çıktıklarında ne zaman sessiz kalmanın daha iyi olacağını her zaman bilmezler.

RadLE 2.0, yeni modelleri dahil etmek için sürekli genişletilecek. Maliyet analizi ve hata sınıflandırması içeren tam bilimsel yayın yakın gelecekte yayınlanacak.

📖 Kaynak