Az NVIDIA nyílt 3D CT-modellt mutatott be radiológiai következtetéshez

Az NVIDIA bemutatta az NV-Reason-CT-t, egy 3D CT-vizsgálatok elemzésére fejlesztett látásnyelvi modellt. A rendszer strukturált leleteket és radiológusi gondolkodást utánzó, lépésenkénti következtetést generál, de kutatási alapmodellként nem önálló diagnosztikai rendszer és nem engedélyezett klinikai termék.
- Az NV-Reason-CT teljes 3D CT-térfogatokat dolgoz fel.
- Strukturált leleteket és radiológusi gondolkodást utánzó következtetést generál.
- A modell a CT-RATE mérésén 0,614-es Macro-F1 és 0,871-es Macro-AUROC értéket ért el.
- Kutatási és fejlesztési alapmodell, nem autonóm diagnosztikai rendszer.
- A Qwen3.5-4B nyelvi modellt 3D ViT-kódolóval kapcsolja össze.
A teljes CT-térfogatot elemzi
Az NVIDIA Developer szeptember 23-án ismertetett modellje olyan problémára készült, amelyet a vállalat szerint a modern látásnyelvi modellek még nehezen kezelnek: a háromdimenziós CT-vizsgálatok értelmezésére. Egy hasi CT-vizsgálat 300 és 600 közötti axiális szeletből is állhat, ezért a képek különálló, kétdimenziós képkockaként történő feldolgozása elveszítheti a szeletek közötti térbeli kapcsolatokat.
Az NV-Reason-CT dedikált, teljes 3D-s látástranszformátort használ. A CT-térfogatot 192³ voxelre, 2 milliméteres izotropikus felbontásra mintavételezi újra, majd nem átfedő, 8x8x8 méretű képpontcsoportokból 24x24x24, vagyis 13 824 látási tokent állít elő. Ezeket a térbeli koordinátáikkal együtt adja át a nyelvi modellnek.
Strukturált leletek és radiológusi gondolkodás
A modell architektúrája a Qwen3.5-4B nyelvi modellt kapcsolja össze a Primus és Colipri technológiákra épülő 3D ViT-kódolóval. Az NVIDIA közlése szerint a rendszer 30 mellkasi és 29 hasi rendellenességet tartalmazó CT-ontológiát használ. Ezek között szerepelnek például a tüdőgócok, a légmell, a májelváltozások és a veseciszták.
Az NV-Reason-CT strukturált radiológiai jelentéseket készít, és a radiológusok szisztematikus vizsgálati folyamatát utánzó következtetési nyomokat is generál. A leírás szerint a modell sorra veszi az anatómiai régiókat, jelzi a releváns eltéréseket, különböző diagnosztikai lehetőségeket mérlegel, valamint bizonytalanságot is megfogalmaz. A felhasználók egyes leletekre vonatkozó kérdéseket tehetnek fel, pontosítást kérhetnek, és többfordulós párbeszédben vizsgálhatják a következtetést.
A nyelvi modellt strukturált jelentések, radiológusok által készített következtetési annotációk és általános vizuális kérdés-válasz adatok felhasználásával tanították. A képzés első szakasza körülbelül 550 000 strukturált kérdés-válasz példát foglalt magában a mellkasi és hasi régiókról. A forrás szerint az adatok között a CT-RATE, az NIH CT-adatkészletei és a CancerVerse is szerepelt.
Eredmények és a kutatási felhasználás korlátai
Az NVIDIA szerint az NV-Reason-CT a CT-RATE mérésén 0,614-es Macro-F1 és 0,871-es Macro-AUROC értéket ért el. A vállalat közlése szerint ezek az eredmények felülmúlták a publikált 3D kontrasztív, valamint a kombinált 2D és 3D alapmodelleket. A strukturált jelentések és a következtetési nyomok klinikai hihetőségét az NIH radiológusai is értékelték, és a lépésenkénti gondolkodást az ellenőrizhetőség szempontjából hasznosnak találták.
Az NV-Reason-CT nyílt kutatási és fejlesztési alapként szolgál. A kutatók és fejlesztők saját CT-alkalmazásaikhoz továbbtaníthatják, illetve más NVIDIA Medical AI-modellekkel együtt használhatják szegmentálásra és szintetikus adatok létrehozására. A közlemény ugyanakkor egyértelműen jelzi, hogy a modell nem autonóm diagnosztikai rendszer és nem engedélyezett klinikai termék. A felhasználók számára ez azt jelenti, hogy jelenlegi szerepe a kutatás és a speciális orvosi AI-alkalmazások fejlesztésének támogatása.
NVIDIA Developer: Introducing NV-Reason-CT Open 3D CT VLM for Radiologist Chain-of-Thought Reasoning


