
NVIDIA-მა 3D CT სკანირებისთვის ღია მოდელი NV-Reason-CT წარადგინა
NVIDIA-მა 3D CT სკანირებისთვის ღია vision-language მოდელი NV-Reason-CT წარადგინა. ის რადიოლოგის აზროვნების ნაბიჯებს, სტრუქტურირებულ დასკვნებსა და მრავალნაბიჯიან დიალოგს აწარმოებს.
NVIDIA-მა NV-Reason-CT წარადგინა — vision-language მოდელი, რომელიც სამგანზომილებიანი კომპიუტერული ტომოგრაფიის (CT) სკანების ანალიზისთვის შეიქმნა. ის სტრუქტურირებულ დიაგნოსტიკურ დასკვნებსა და ნაბიჯ-ნაბიჯ მსჯელობას აწარმოებს, რომელიც რადიოლოგის ლოგიკას იმეორებს — კომპანიამ ამის შესახებ 2026 წლის 23 სექტემბრის ბლოგპოსტში განაცხადა.
NV-Reason-CT აგრძელებს NV-Reason-CXR-ის მიდგომას — გულმკერდის რენტგენის ანალიზის მოდელი, რომლის კლინიკური კვლევაც RSNA 2026-ზე მიიღეს და რადიოლოგების დროის დაზოგვა დაადასტურეს.
რატომ სჭირდება 3D CT-ს განსხვავებული მიდგომა
მუცლის ერთი CT კვლევა 300–600 კვეთს მოიცავს — ანატომია სამ სივრცულ განზომილებაშია ჩაწერილი. სტანდარტული VLM-ები გამოსახულებას ორგანზომილებიან ტოკენთა ბადედ აღიქვამენ, ამიტომ მოცულობის დამოუკიდებელი კადრების დასტად დამუშავება კვეთებს შორის იმ კავშირებს კარგავს, რომლებიც სიმსივნურ წარმონაქმნებს, ეფუზიებსა და ინფილტრატებს კლინიკურად მნიშვნელოვანს ხდის.
NVIDIA კიდევ ორ ხარვეზს ასახელებს: მოდელები ხშირად მხოლოდ დიაგნოზის იარლიყს აბრუნებენ და არ ხსნიან, რატომ; არსებულ სისტემებს კი აკლია მრავალნაბიჯიანი დიალოგი, რომელიც რადიოლოგს აღმოჩენის გადამოწმებისთვის სჭირდება.
3D ტრანსფორმერი და 4B ენის მოდელი
არქიტექტურა სრულფასოვან 3D vision transformer ენკოდერსა და Qwen3.5-4B ენის მოდელს აერთიანებს. CT მოცულობა 2 მმ იზოტროპული გარჩევადობით 192³ ვოქსელზე მცირდება და 8×8×8 პატჩ-ტოკენებად იყოფა — სულ 13 824 ვიზუალური ტოკენი, რომლებიც 3D კოორდინატებთან ერთად ენის მოდელს გადაეცემა. 3D MRoPE სივრცით კავშირებს ყველა ფენაში ინარჩუნებს; ყველა წონა ბოლომდე ხელახლა გაწვრთნეს.
სწავლება ორ ეტაპად წარიმართა: ჯერ supervised fine-tuning დაახლოებით 550 000 სტრუქტურირებულ QA-მაგალითზე — რადიოლოგების ნაკარნახევი მსჯელობის ანოტაციების ჩათვლით — შემდეგ reinforcement learning GRPO-სა და ანატომიის მიხედვით შეფასებული ჯილდოს მეშვეობით.
შედეგები და კლინიკური შეფასება
CT-RATE-ზე — 3D CT-ის გაგების წამყვან საჯარო ბენჩმარკზე — NV-Reason-CT 0,614 Macro-F1-ს და 0,871 Macro-AUROC-ს აჩვენა და 3D კონტრასტულ მოდელებს VoxelFM-ს (0,581/0,870), Pillar-0-ს (0,544/0,861), ClinFusion-8B-ს (0,442) და MedGemma 1.5-ს (0,303) გაუსწრო. კომპანიის თქმით, პირველად ერთი ღია მოდელი ერთდროულად კონკურენტუნარიანი აღმოჩნდა როგორც CT-ის კლასიფიკაციაში, ისე დასკვნის გენერაციაში.
აშშ-ის ჯანდაცვის ეროვნული ინსტიტუტების (NIH) რადიოლოგებმა შედეგები შეაფასეს. NIH-ის უფროსი კლინიკოსის, ბარის თურქბეის თქმით, მოდელის ნაბიჯ-ნაბიჯ მსჯელობა იმას ასახავს, თუ როგორ ფიქრობენ რადიოლოგები CT კვლევაზე რეალურად; მისივე თქმით, სწორედ აზროვნების პროცესის, და არა მხოლოდ დასკვნის, დანახვა ხდის შედეგებს სანდოსა და მოქმედებისთვის ვარგისს.
რას ნიშნავს ღია მოდელი
NV-Reason-CT ღია კვლევითი და განვითარების საფუძველია, არა ავტონომიური დიაგნოსტიკური სისტემა ან დამტკიცებული კლინიკური პროდუქტი. წონები Hugging Face-ზეა ხელმისაწვდომი, GitHub-ის რეპოზიტორიაში კი inference სკრიპტები, სწავლების კონფიგურაციები და post-training რეცეპტები. მოდელი NVIDIA Medical AI-ის ოჯახს — NV-Generate-CTMR-სა და NV-Segment-CTMR-ს — შეუერთდა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.