MIT: az orvosi AI másként segíti a laikusokat és a klinikusokat

Az MIT News 2026. augusztus 4-én számolt be egy Nature Medicine-ben megjelent kutatásról, amely a bőrbetegségek diagnosztikájában vizsgálta a magyarázható AI hatását. A tanulmány szerint az AI általában javította a laikusok és az alapellátásban dolgozó klinikusok pontosságát, de a magyarázatok hatása erősen függött a felhasználó szakértelmétől.
- Az MIT által ismertetett tanulmány bőrbetegségek diagnosztikájában vizsgálta a magyarázható AI hatását.
- A laikusok pontossága javult, de nagyrészt azért, mert erősen követték az AI tanácsát.
- Az LLM-alapú magyarázatok akkor is bizalmat keltettek a laikusokban, amikor hibásak voltak.
- A klinikusok jobban felismerték az AI tévedéseit, és magyarázat nélkül, puszta modellpredikcióval teljesítettek a legjobban.
- A kutatók szerint az AI-ajánlások megjelenítésének módja legalább olyan fontos, mint maga a predikció.
A laikusok könnyebben rábízták magukat az AI-ra
Az MIT és más intézmények kutatói azt találták, hogy az egységes megközelítés valószínűleg nem jó stratégia olyan mesterségesintelligencia-rendszerek tervezésénél, amelyek betegségdiagnózisban segítik a felhasználókat. A vizsgálatban laikusok és alapellátásban dolgozó szolgáltatók kaptak bőrbetegségekkel kapcsolatos feladatokat, AI-segítséggel és anélkül.
A magyarázható AI-módszerek célja, hogy segítsék a felhasználót annak eldöntésében, mikor bízzon a modell előrejelzésében. A forrás példái szerint ilyen lehet egy hőtérkép, amely megjelöli a diagnózis szempontjából fontos képrégiókat, vagy egy nagy nyelvi modell, amely közérthető szövegben magyarázza a predikciót.
A tanulmány szerint a laikusok diagnosztikai pontossága javult, de ez nagyrészt abból fakadt, hogy rábízták magukat az AI-rendszerre. Az LLM-alapú magyarázatokat akkor is elhitték, ha azok helyesek voltak, és akkor is, ha hibásak. A kutatók azt is megfigyelték, hogy a laikusok meggyőzőbbnek találták a magyarázatokat, ha azok homályosak vagy általánosak voltak.
A klinikusok ezzel szemben kevésbé dőltek be a hibás AI-segítségnek. A kutatás szerint ők akkor teljesítettek a legjobban, amikor csak a modell előrejelzését kapták meg, kísérő magyarázat nélkül.
Négyféle AI-segítséget teszteltek bőrgyógyászati feladatokon
A kutatók többféle magyarázható AI-megközelítést próbáltak ki. Az egyik esetben a felhasználók AI-előrejelzést és konfidenciaszintet kaptak magyarázat nélkül. Egy másik módszer hasonló képekkel erősítette meg a predikciót. A harmadik hőtérképet használt, a negyedik pedig LLM-mel, egyszerű nyelven írta le a modell érvelését.
A laikusoknak azt kellett eldönteniük, hogy egy bőranyajegyet ábrázoló kép rákos elváltozást mutat-e. A klinikusok nehezebb feladatot kaptak: bőrgyógyászati betegség differenciáldiagnózisát kellett megadniuk.
A kutatók szerint minden magyarázható AI-megközelítés javította a laikusok pontosságát, főként azért, mert az eszközök segítettek felismerni a nem rákos anyajegyeket. Amikor egy, a sötétebb bőrtónusokkal szembeni torzítás mérséklésére tervezett, méltányossági korlátot alkalmazó modellt használtak, a rendszer jelentősen javította a pontosságot, és csökkentette a bőrtónus alapján jelentkező diagnosztikai eltéréseket.
Marzyeh Ghassemi, az MIT Department of Electrical Engineering and Computer Science docense szerint ugyanakkor a laikus felhasználók jobb eredményeinek oka az volt, hogy erősebben támaszkodtak a modellekre. Az MIT News idézete szerint: „De azért jobbak a laikus felhasználók, mert jobban támaszkodnak a modellekre. Amikor a modell téved, az jobban rontja a teljesítményt, mint amennyit javít, amikor a modellnek igaza van. Egyszerűen nagyon jó AI-modelleket tudtunk betanítani erre a helyzetre.”
Az LLM-magyarázat különösen erős bizalmi hatást váltott ki
A forrás szerint a ráhagyatkozási hatás az LLM-magyarázatoknál volt a legerősebb. A felhasználók magabiztosabbak voltak a téves válaszaikban, ha egy LLM segítette őket. A klinikusoknál más volt a helyzet: ellenállóbbnak bizonyultak a hibás AI-magyarázatokkal szemben, és a magyarázhatósági módszerek közül az LLM-ek javították legkevésbé a pontosságukat.
Orson Xu, a Columbia University Department of Biomedical Informatics adjunktusa és a tanulmány vezető szerzője az MIT Newsnak azt mondta: „Ez valójában azon múlik, hogy az egyes csoportok hogyan használják a magyarázatot. Egy klinikusnak már van diagnózis a fejében, és az AI-t a saját képzettségéhez méri, így a rossz magyarázat fennakad. Egy laikus közben ugyanezt a magyarázatot arra használhatja, hogy egyáltalán kialakítsa a véleményét, ezért egy hihető, magabiztosnak hangzó indoklás a rossz válasz felé húzhatja. Ugyanaz az eszköz az egyik felhasználónak előny, a másiknak kockázat.”
A kutatók azt is megállapították, hogy azok a felhasználók voltak a leginkább hajlamosak követni az AI-segítséget, akik AI nélkül a legrosszabbul teljesítettek. Számított az is, mikor jelent meg a magyarázat. Ha a felhasználó előbb kapta meg az AI indoklását, mint hogy saját diagnózist alkotott volna, nagyobb eséllyel vált a modell követőjévé.
A tanulmány szerint az AI-rendszerek jobban teljesítettek az embereknél, amikor a betegség megjelenése finom, nehezen észrevehető volt. Az emberek viszont sokkal jobbak voltak akkor, ha atipikus tünetek vagy a képen látható, nem kapcsolódó jellemzők jelentek meg.
Mit jelenthet ez a felhasználóknak és az egészségügyi AI piacának?
A kutatók szerint az eredmények arra figyelmeztetnek, hogy az AI-rendszereket a felhasználók szem előtt tartásával kell megtervezni. Ugyanaz a magyarázat segíthet egy szakértőnek, de félrevihet egy kezdőt. Ez különösen fontos, mert az MIT News szerint a betegek egyre gyakrabban fordulnak AI-hoz az egészségügyi döntéseik támogatására.
Roxana Daneshjou, a Stanford University orvosbiológiai adattudománnyal és bőrgyógyászattal foglalkozó adjunktusa, a tanulmány társszerzője az MIT Newsnak így fogalmazott: „Ezek az eredmények fontosak, mivel a betegek egyre inkább az AI-hoz fordulnak, hogy segítséget kapjanak az egészségügyi ellátásukhoz. Eredményeink azt mutatják, hogy a legkevesebb orvosi tudással rendelkezők a legnagyobb valószínűséggel tévednek rossz irányba, amikor a magyarázható AI-modellek hibás kimenetet adnak.”
A kutatók szerint a megoldás nem feltétlenül a részletesebb LLM-magyarázatok gyártása. Hatékonyabb lehet, ha a felhasználónak előbb saját diagnosztikai hipotézist kell adnia, és az AI csak ezután javasol további lehetséges állapotokat megfontolásra.
Ghassemi szerint az AI-nak olyan szerepet kellene kapnia, amely javítja a kreativitást, fejleszti a felhasználót, vagy kiegészíti a hiányosságait azokban az esetekben, amikor finom tüneteket nem vesz észre. A kutatás leírása a Nature Medicine-ben jelent meg, finanszírozásában részben a National Science Foundation, a Schmidt Sciences, a National Bureau of Economic Research és a Columbia University vett részt.


