Назад
NVIDIA представила NV-Reason-CT — відкриту модель для аналізу 3D КТ
SiTech AI Team2 წთ. საკითხავი

NVIDIA представила NV-Reason-CT — відкриту модель для аналізу 3D КТ

NVIDIA представила NV-Reason-CT — мовно-візуальну модель, створену для аналізу тривимірних КТ-сканувань. Вона генерує структуровані звіти та покрокові міркування в стилі радіолога, а ваги відкриті на Hugging Face.

NVIDIA представила NV-Reason-CT — мовно-візуальну модель (VLM), спеціально створену для аналізу тривимірних комп'ютерних томографій (КТ). Модель формує структуровані діагностичні звіти та покрокові міркування, що відтворюють логіку роботи радіолога з дослідженням, повідомила компанія в блозі 23 вересня 2026 року.

Реліз поширює на об'ємну візуалізацію підхід, започаткований із NV-Reason-CXR — моделлю для аналізу рентгенівських знімків грудної клітки, клінічне дослідження якої прийняли на RSNA 2026; воно підтвердило економію часу радіологів за збереження діагностичної точності.

Чому 3D КТ потребує окремого підходу

Одне дослідження черевної порожнини може містити 300–600 аксіальних зрізів, тож анатомія закодована у трьох просторових вимірах. Стандартні VLM сприймають зображення як двовимірну сітку токенів, тому обробка об'єму як стосу незалежних кадрів руйнує зв'язки між зрізами, які й надають новоутворенням, випотам та інфільтратам клінічного значення.

NVIDIA вказує ще на дві прогалини: моделі, які правильно помічають відхилення, часто видають лише мітку й не пояснюють чому, а більшість наявних систем не мають багатоходової розмови, потрібної радіологу для перевірки знахідки.

3D-трансформер і мовна модель на 4B

Архітектура поєднує повноцінний 3D-енкодер vision transformer із мовною моделлю Qwen3.5-4B. КТ-об'єм приводиться до 192³ вокселів з ізотропною роздільністю 2 мм і розбивається на 8×8×8 патч-токени — разом 13 824 візуальні токени, які передаються мовній моделі разом із їхніми 3D-координатами. Схема 3D MRoPE зберігає просторові зв'язки на всіх шарах. Усі ваги перенавчали наскрізно.

Навчання відбувалося у два етапи: спершу supervised fine-tuning на приблизно 550 000 структурованих QA-прикладів для грудної та черевної ділянок, включно з продиктованими радіологами анотаціями міркувань, потім reinforcement learning із GRPO та анатомічно зваженою винагородою.

Результати та клінічна оцінка

На CT-RATE, головному публічному бенчмарку для розуміння 3D КТ, NV-Reason-CT показує Macro-F1 0,614 і Macro-AUROC 0,871 — попереду 3D-контрастивних VoxelFM (0,581/0,870) і Pillar-0 (0,544/0,861), а також ClinFusion-8B (0,442) та MedGemma 1.5 (0,303). За словами NVIDIA, це вперше одна відкрита модель стала конкурентною одночасно в класифікації КТ і генерації звітів.

Радіологи NIH оцінили результати; Баріс Туркбей, доктор медицини, старший клініцист Національних інститутів охорони здоров'я, зазначив, що покрокові міркування моделі відображають реальний хід думок радіолога над КТ-дослідженням, а можливість бачити процес, а не лише висновок, дозволяє довіряти знахідкам і діяти за ними.

Що означає «відкритий» статус

NV-Reason-CT — відкрита дослідницька та розробницька основа, а не автономна діагностична система чи схвалений клінічний продукт. Ваги доступні на Hugging Face, репозиторій на GitHub містить скрипти інференсу, конфігурації навчання та рецепти донавчання. Модель доповнює родину NVIDIA Medical AI разом із NV-Generate-CTMR і NV-Segment-CTMR.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.