MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban 933 orvosi vizsgakérdés minden mondatát emberek és hat nyelvi modell értékelte.
- A MedPAIR 933 orvosi vizsgakérdés mondatszintű relevanciáját vizsgálja.
- Az értékelésben 52 orvostanhallgató, hét szakorvos és hat nyelvi modell vett részt.
- Az emberek három relevanciakategóriát használtak, a modelleknél kontextuspontszámokat is mértek.
- A kutatók azt is vizsgálják, szükségesek-e a relevánsnak jelölt mondatok a helyes válaszhoz.
- Az adatbázis a Hugging Face platformon érhető el.
Nem elég a helyes válasz
A MedPAIR a Measuring Physician, AI Relevance Alignment rövidítése. A projekt azt vizsgálja, mennyire hasonlóan értelmezik az orvosok és a mesterséges intelligencia rendszerei a releváns információkat az orvosi kérdések megválaszolásakor.
A kutatás alapvető kérdése, hogy ha egy modell helyesen válaszol egy klinikai kérdésre, ugyanazokra a bizonyítékokra támaszkodik-e, amelyekre egy orvos is. A helyes végső válasz önmagában ugyanis nem mutatja meg, hogy a modell valóban a klinikailag fontos információkat használta-e fel, vagy például korábbi tanulási adataiból idézett fel egy hasonló választ.
A projektet Yuexing Hao, a MatrAIx társalapítója és operatív vezetője mutatta be a Snorkel AI olvasócsoportjában. Hao korábban az MIT Healthy ML Group posztdoktori kutatója volt, doktori fokozatát pedig a Cornell Egyetemen szerezte.
Orvosok és hat nyelvi modell értékelte a mondatokat
A vizsgálat az amerikai USMLE orvosi vizsgához hasonló, feleletválasztós kérdéseket használ. Egy esethez betegprofil, kérdés és több lehetséges válasz tartozik. A kutatók először minden mondatot külön értékeltettek a betegprofilban.
Az értékelők három kategóriát használhattak: erősen releváns, alacsony relevanciájú vagy irreleváns. Az emberi annotációkat 52 orvostanhallgató és hét szakorvos készítette. Csak azoknak az értékeléseit vették figyelembe, akik előzőleg helyesen válaszoltak a kérdésre. Az emberi címkéket többségi szavazással összesítették.
Ugyanezeket az eseteket hat nyelvi modell is elemezte. A kutatás nyílt és zárt forrású modelleket is használt, finomhangolás nélkül. A modellektől kétféle értékelést kértek: a kérdésre adott utasítás alapján megfogalmazott, önbevalláson alapuló relevanciaítéletet, valamint olyan kontextuspontszámot, amely azt jelezte, mekkora súlyt kapott az egyes mondat a válasz kialakításakor. A nyílt forrású modelleknél ezt a ContextCite segítségével számították ki.
A MedPAIR adatbázis felépítése
A kutatás két lépésből állt. Először összegyűjtötték a mondatszintű relevanciaértékeléseket. Ezután azt vizsgálták, hogy a relevánsnak ítélt mondatok valóban szükségesek-e a klinikai döntéshez. Ehhez eltávolították a többi mondatot, majd megnézték, hogy az ember vagy a modell továbbra is helyesen válaszol-e.
A modellek és az orvosok összehasonlításához azonos számú mondatot tartottak meg minden kérdésnél. Először az orvostanhallgatók többségi értékelése alapján választották ki a legfontosabb mondatokat, majd ugyanennyi mondatot jelöltek ki az egyes modellek kontextuspontszámai alapján.
A MedPAIR az eredeti, nyilvános adatbázisokból származó kérdéseket, az orvostanhallgatók annotációit, a modellek kontextuspontszámait és önbevallott relevanciajelöléseit egyesíti. Az adatbázis a Hugging Face platformon érhető el.
A kutatók egy úgynevezett téves relevanciaarányt is definiáltak. Ez azt méri, megváltozik-e a modell válasza, ha eltávolítják az alacsony relevanciájúnak vagy irrelevánsnak jelölt mondatokat. Így azt vizsgálhatják, hogy a klinikailag fontos információkra való szűkebb fókusz javítja-e a modellek előrejelzéseit.
Miért fontos a relevancia vizsgálata?
A Snorkel AI forrása szerint a kérdés azért vált egyre fontosabbá, mert több vállalat is orvosi nagy nyelvi modellek fejlesztésén dolgozik. A kutatás hátterében az a felismerés áll, hogy több betegadat hozzáadása nem minden esetben javítja a diagnosztikai döntést. A forrásban idézett, 2024-es Nature Medicine tanulmány szerint a laboreredmények, képalkotó vizsgálatok és fizikális vizsgálati adatok hozzáadása bizonyos esetekben még csökkenthette is a diagnosztikai pontosságot.
A MedPAIR ezért nem kizárólag azt kérdezi, hogy egy modell jól válaszol-e, hanem azt is, milyen információkra támaszkodik. A Snorkel AI Open Benchmarks Grants programja támogatta a munkát. Hao a kutatást október 8-án a Snorkel Frontier Data Summit rendezvényén is bemutatja, a kapcsolódó, egészségügyi LLM- és VLM-alkalmazásokról szóló workshopot pedig október 9-én tartják a COLM keretében.


