
NVIDIA, 3D BT analizi için açık model NV-Reason-CT'yi tanıttı
NVIDIA, üç boyutlu BT taramalarını analiz etmek için geliştirilen açık görsel-dil modeli NV-Reason-CT'yi tanıttı. Model, radyolog tarzı adım adım akıl yürütme ve yapılandırılmış raporlar üretiyor.
NVIDIA, üç boyutlu bilgisayarlı tomografi (BT) taramalarını analiz etmek için özel olarak geliştirilen görsel-dil modeli (VLM) NV-Reason-CT'yi tanıttı. Şirketin 23 Eylül 2026'da yayımladığı blog yazısına göre model, yapılandırılmış tanı raporları ve bir radyologun inceleme sürecini yansıtan adım adım akıl yürütme üretiyor.
Sürüm, NVIDIA'nın göğüs röntgeni için geliştirdiği NV-Reason-CXR modelinin yaklaşımını hacimsel görüntülemeye taşıyor; bu modelin çok okuyuculu klinik çalışması RSNA 2026'ya kabul edilmiş ve tanı doğruluğu korunurken radyologların zaman tasarrufunu doğrulamıştı.
3D BT neden farklı bir yaklaşım gerektiriyor
Tek bir karın BT incelemesi 300–600 aksiyel kesit içerebilir; anatomi üç uzamsal boyutta kodlanır. Standart VLM'ler görüntüyü iki boyutlu bir token ızgarası olarak ele alır, hacmi bağımsız karelerden oluşan bir yığın gibi işlemek ise kitle, efüzyon ve infiltratları klinik olarak anlamlı kılan kesitler arası ilişkileri kaybeder.
NVIDIA iki ek boşluğa daha işaret ediyor: bir anormalliği doğru saptayan modeller çoğu zaman nedenini açıklamadan etiket üretiyor ve mevcut sistemlerin çoğunda radyologun bulguyu sorgulaması için gereken çok turlu diyalog derinliği yok.
3D dönüştürücü ve 4B'lik dil modeli
Mimari, tam bir 3D vision transformer kodlayıcısını Qwen3.5-4B dil modeliyle birleştiriyor. BT hacmi 2 mm izotropik çözünürlükte 192³ voksele indirgeniyor ve 8×8×8'lik yama tokenlarına bölünüyor: toplam 13.824 görsel token, 3D ızgara koordinatlarıyla birlikte dil modeline aktarılıyor. 3D MRoPE düzeni uzamsal ilişkileri katmanlar boyunca koruyor. Tüm ağırlıklar uçtan uca yeniden eğitildi.
Eğitim iki aşamada yürütüldü: önce göğüs ve karın bölgelerini kapsayan yaklaşık 550.000 yapılandırılmış QA örneğiyle denetimli ince ayar, ardından anatomiye duyarlı ödülle GRPO tabanlı pekiştirmeli öğrenme.
Sonuçlar ve klinik değerlendirme
3D BT anlayışının önde gelen açık kıyaslaması CT-RATE'te NV-Reason-CT, 0,614 Macro-F1 ve 0,871 Macro-AUROC bildiriyor — VoxelFM (0,581/0,870), Pillar-0 (0,544/0,861), CT-CLIP ve Merlin gibi 3D kontrastif modellerin, ayrıca ClinFusion-8B (0,442) ve MedGemma 1.5'in (0,303) önünde. NVIDIA'ya göre tek bir açık model ilk kez hem BT sınıflandırmasında hem rapor üretiminde rekabetçi oldu.
NIH radyologları çıktıları inceledi; Ulusal Sağlık Enstitüleri'nde kıdemli klinisyen olan Dr. Baris Turkbey, modelin adım adım akıl yürütmesinin radyologların BT incelemesine gerçekte nasıl yaklaştığını yansıttığını, sonucu değil düşünce sürecini görebilmenin bulgulara güvenmeyi mümkün kıldığını söyledi.
“Açık” ne anlama geliyor
NV-Reason-CT açık bir araştırma ve geliştirme temeli; otonom bir tanı sistemi ya da onaylı bir klinik ürün değil. Model ağırlıkları Hugging Face'te, GitHub deposunda ise çıkarım betikleri, eğitim yapılandırmaları ve sonradan eğitim tarifleri var. Model, NV-Generate-CTMR ve NV-Segment-CTMR ile birlikte NVIDIA Medical AI ailesine katılıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.