A Microsoft Research bemutatta a CARE-X radiológiai kutatási modellt

A Microsoft Research 2026. augusztus 11-én mutatta be a CARE-X nevű radiológiai látás-nyelvi kutatási modellt. A rendszer mellkasröntgenek többféle értelmezési feladatát célozza, de a közlemény szerint nem Microsoft-termék, nem orvostechnikai eszköz, és nem használható klinikai diagnózisra vagy betegellátásra.
- A CARE-X a Microsoft Research radiológiai kutatási modellje mellkasröntgenek értelmezésére.
- A rendszer generatív szöveges válaszokat és strukturált, konfidenciaértékes kimeneteket kombinál.
- Az architektúra SigLIP2-so400M látáskódolót és Phi-4-mini-instruct (3.8B) nyelvi modellt használ.
- A Microsoft Research Narayana Healthtől származó valós indiai klinikai adatokon validálta a kutatási eredményeket.
- A CARE-X nem Microsoft-termék, nem orvostechnikai eszköz, és nem klinikai diagnózisra vagy betegellátásra készült.
Egységes modell több radiológiai feladatra
A CARE-X a Microsoft Research szerint azt vizsgálja, hogyan lehet egyetlen mellkasröntgenre specializált látás-nyelvi modellel többféle klinikai értelmezési feladatot lefedni. A radiológiai munkában ugyanaz a kép szolgálhat részletes lelet megírására, rövid diagnosztikai összegzés készítésére, eltérések jelenlétének vagy hiányának megválaszolására, orvosi eszközök felismerésére, azok elhelyezkedésének értékelésére, illetve képi régiók pontos megjelölésére.
A forrás szerint a klinikailag hasznos rendszernek nem elég gördülékeny szöveget előállítania. A kimenetnek orvosilag pontosnak is kell lennie, mert egy jól megfogalmazott jelentés is lehet hibás, ha kihagy egy eltérést, félrekezeli a tagadást, vagy rossz helyet azonosít.
A CARE-X ezért generatív és diszkriminatív képességeket kombinál. Szabad szöveges válaszokat adhat, miközben bizonyos feladatoknál strukturált előrejelzéseket és konfidenciaértékeket is előállít. A Microsoft Research ezt dual inference módként írja le: egyetlen előrehaladás során autoregresszív válasz és egy kiegészítő fej által adott strukturált predikció is készül.
Miért lát hiányosságokat a Microsoft Research a jelenlegi VLM-eknél?
A bejegyzés három fő problémát emel ki a mai radiológiai látás-nyelvi modelleknél. Az első a kalibrált bizalom hiánya diagnosztikai döntéseknél. A generatív VLM-ek szövegként adnak diagnózist, de a Microsoft Research szerint jellemzően nem adnak olyan kalibrált konfidenciapontszámokat, amelyekkel a klinikusok különböző helyzetekben állíthatnák az érzékenység és specificitás közötti kompromisszumot.
A második hiányosság, hogy a szokásos keresztentrópia-veszteség nem közvetlenül a klinikai hűséget optimalizálja. A forrás példái szerint egy koordinátahiba hasonló büntetést kaphat, mint egy ártalmatlan megfogalmazásbeli eltérés, egy igen válasz nemre fordulhat, vagy egy életveszélyes lelet kihagyása ugyanabba a tanulási logikába kerülhet, mint egy kisebb megfigyelés elhagyása.
A harmadik terület a mérésfüggő leletek kezelése. A Microsoft Research példaként a cardiomegaliát és a mediastinalis kiszélesedést említi, ahol a vizuális felismerés önmagában kevés lehet. Cardiomegalia esetén például a szív és a mellkas szélességének mérésére, majd a cardiothoracalis arány meghatározására van szükség, miközben olyan tényezőket is figyelembe kell venni, mint a felvételi irány, az expozíció vagy a beteg rotációja.
Felépítés: SigLIP2, Phi-4-mini-instruct és kiegészítő fejek
A CARE-X architektúrája egy SigLIP2-so400M látáskódolóra és egy Phi-4-mini-instruct (3.8B) nyelvi modellre épül, amelyeket könnyű adapter köt össze. A közös nyelvi gerinchez feladatspecifikus kiegészítő fejek kapcsolódnak osztályozáshoz és vizuális lokalizáláshoz.
A Microsoft Research szerint ezek a fejek kalibrált diagnosztikai előrejelzéseket és térbeli lokalizációs jeleket adnak, miközben reprezentációkat osztanak meg a generatív nyelvi modellel. A bejegyzés hangsúlyozza, hogy a fejeket nem külön képzik, hanem a nyelvmodellezési céllal együtt, így a strukturált felügyelet a közös reprezentációkat is gazdagíthatja.
A tréning háromlépcsős felügyelt finomhangolási folyamatból áll: látási előtanítás, adapter és fejek tanítása, majd LoRA-adaptáció. Ezt DAPO-alapú megerősítéses tanulás követi. A DAPO a közlemény szerint feladatspecifikus jutalmakkal optimalizálja a klinikai jelentéskészítést, a diagnosztikai pontosságot és a térbeli lokalizáció minőségét.
Milyen feladatokat fed le a CARE-X?
A bejelentés táblázata szerint a CARE-X több mellkasröntgen-feladatra készült. Generatív módban készít részletes findings szakaszt, rövid impression szakaszt, betegséghelyeket azonosít, finom felbontású többcímkés betegséggel kapcsolatos osztályozást végez, valamint látható csöveket és vezetékeket ismer fel.
Dual inference módban kezeli a jelenlét és tagadás megítélését, a csövek és vezetékek rendellenes elhelyezésének felismerését, a kóros leletet leíró kifejezések képi lokalizálását, valamint 29 anatómiai régió lokalizálását. Ezeknél a feladatoknál a szöveges rugalmasság mellett küszöbölhető, konfidenciaértékkel ellátott kimenet is megjelenik.
A modell értékeléséhez a Microsoft Research valós indiai klinikai adatokat használt a Narayana Healthtől, beleértve ritka intenzív osztályos patológiákat és CT-vel megerősített megnagyobbodási állapotokat. A forrás ugyanakkor külön jelzi, hogy az eredmények retrospektív kutatási megállapítások, és nem igazolják a CARE-X biztonságosságát, hatékonyságát vagy klinikai alkalmasságát.
Mit jelenthet ez a felhasználóknak és a piacnak?
A CARE-X jelentősége a forrás alapján abban van, hogy a radiológiai AI-rendszerek egy gyakorlati problémáját célozza: a szabad szöveges magyarázat és a strukturált, küszöbölhető döntési kimenet együttes igényét. A bejegyzés szerint a kiegészítő fejekkel végzett közös tanítás javíthatja a generatív teljesítményt ugyanazokon a feladatokon, miközben kalibrált strukturált predikciókat is ad.
A Microsoft Research konkrét javulásokat is közöl a lokalizációs feladatoknál. Anatómiai lokalizálásban a Chest ImaGenome adaton az mAP +28.2 százalékponttal, az mIoU +6.2 százalékponttal nőtt. Kifejezésalapú lokalizálásban a PadChest adaton a legnagyobb növekedés +24.6 százalékpont mAP és +14.1 százalékpont mIoU volt. A bejegyzés szerint a DAPO-val tanított generatív kimenet anatómiai grounding feladaton 0.868 mAP értékkel meghaladta az SFT detekciós fej 0.865 mAP értékét.
A gyakorlati alkalmazás azonban a forrás szerint még kutatási kérdés. A CARE-X nem elérhető klinikai képességként, nem jóváhagyott orvostechnikai eszköz, és a lehetséges munkafolyamatokra vonatkozó utalások jövőbeli kutatási területeket jelölnek.
Microsoft Research: Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement


