Így vizsgálnák, hogy biztonságosak-e a chatbotok orvosi tanácsai

Egy igaz állítás is veszélyes lehet, ha egy chatbot nem közli a szükséges figyelmeztetéseket. Az USC ALICE projektje olyan módszereket fejleszt, amelyekkel az orvosi válaszok pontosságát, teljességét és biztonságosságát vizsgálnák.
- Az ALICE az orvosi chatbot-válaszok pontosságát, teljességét és biztonságát vizsgálja.
- A kutatók szerint fontos hibák és figyelmeztetések maradhatnak ki a válaszokból.
- Az egyik automatikus módszer a valódi hiányosságok több mint 90 százalékát felismerte egy tesztben.
- Az automatikus ellenőrzők jelenleg nem helyettesítik az orvosi szakértői döntést.
- A projekt célja, hogy a jövőben független tanúsítás segítse a felhasználókat.
Egy helyes válasz is félrevezető lehet
Az USC Viterbi School of Engineering és az USC Stevens School for Computing and Artificial Intelligence ismertetése szerint egy anya azt kérdezi egy chatbottól, biztonságos-e a paracetamol a csecsemője számára. A rendszer igennel válaszol, de nem feltétlenül magyarázza el, hogy a csecsemőknek és a gyermekeknek szánt készítmények koncentrációja eltérhet, ezért az adagolásuk is más lehet.
Az ilyen válaszok kockázata, hogy a chatbot néhány másodperc alatt nyugodt és magabiztos hangnemben ad tanácsot, miközben tényt találhat ki, kisebbítheti egy sürgős helyzet jelentőségét, vagy kihagyhat egy fontos figyelmeztetést. A felhasználó emiatt késleltetheti az ellátást, rossz adagot vehet be, vagy olyan kezelést követhet, amely nem segít.
„Ha 90 százalékban helyes, mit teszünk?” idézi az USC Marjorie Freedmant, az USC Information Sciences Institute, vagyis az ISI mesterségesintelligencia-részlegének vezető kutatóját és társigazgatóját. Szerinte a fennmaradó 10 százalék „nagyon félrevezető” és akár káros is lehet.
Az ALICE nem egyetlen pontszámot keres
Freedman vezeti az ALICE nevű projektet, amelynek neve az Assessing LLM Integrity for Clinical Engagement rövidítése. A kutatásban Jonathan May, az USC Viterbi és az USC Stevens számítástechnikai tanszékének kutatóprofesszora, az ISI vezető kutatója és mesterségesintelligencia-részlegének igazgatója is részt vesz.
A projekt olyan eszközöket fejleszt, amelyek az orvosi kérdésekre adott chatbot-válaszokat vizsgálják. A cél a hamis állítások és a hiányzó információk felismerése, miközben azt is ellenőriznék, hogy a válasz érthető, hasznos és a beteg, a szülő vagy az egészségügyi szakember számára megfelelően sürgős hangvételű-e.
A kutatók az automatikus értékelők mellett emberi szakértők által ellenőrzött adatkészleteket is készítenek. Három chatbot több száz válaszát vizsgálták, amelyek között körülbelül 500 szavas szövegek is voltak. Az egyik vizsgálatban az első ellenőrzők gyakran nem vették észre a valódi hibákat, amelyeket később más értékelők, orvosi szakértők és hivatásos tényellenőrök azonosítottak.
A szakértők sem mindig értenek egyet
A későbbi szakértői ellenőrzés sem adott minden esetben egyértelmű választ. A szakértők időnként eltérően ítélték meg, hogy egy állítás valóban hibás-e. Amikor egy chatbotot további ellenőrként vontak be, több lehetséges hibát talált, mint az emberek, de olyan tévedéseket is kihagyott, amelyeket a humán értékelők felismertek.
„Nagyfokú árnyaltság kell annak megállapításához, mi az objektív igazság egy egyszerű állításban”, mondta May az USC beszámolója szerint. A forrás eredeti szövegében szereplő gondolatjel helyett magyar mondatszerkezetben: May szerint egy egyszerű állítás objektív igazságának meghatározása is rendkívül árnyalt feladat.
Egy másik vizsgálat az elhallgatott információkra összpontosított. Orvosi szakértők valódi betegkérdésekre adott válaszokat elemeztek, és megjelölték a hiányzó, fontos információkat. Három automatikus módszert teszteltek, közülük a legerősebb az egyik tesztkészletben a valódi hiányosságok több mint 90 százalékát megtalálta. Ugyanakkor sok téves riasztást is adott, ezért jelenleg inkább szakértői ellenőrzésre kijelölt válaszok szűrésére alkalmas, mint az orvosi döntés kiváltására.
A projekt független tanúsítást szeretne
Az ALICE kutatói szerint az orvosi chatbotok értékelésénél a pontosság és a teljesség mellett azt is vizsgálni kell, hogy a válasz közérthető magyarázatot, hasznos következő lépéseket és egyértelmű jelzést ad-e arról, ha sürgős ellátásra van szükség. A kutatócsoport az eredmények, az adatok és a módszerek megosztására készül, hogy mások is folytathassák a munkát a támogatási időszak után.
Freedman szerint továbbra is nehéz pontosan meghatározni, mitől teljes egy orvosi válasz. A chatbotokat ma sokan az alapján ítélik meg, mennyire kifinomult, világos vagy együttérző a szövegük, de ezek a tulajdonságok önmagukban nem bizonyítják, hogy a tanács megbízható.
May célja, hogy a független tesztelés erősebb alapot adjon a felhasználóknak annak eldöntéséhez, mely rendszerekben bízhatnak. A kutató szerint hasonló tanúsítást szeretnének biztosítani a magas kockázatú területeken, például az orvostudományban és az orvosi kérdéseknél. A két évre szóló projektet az Advanced Research Projects Agency for Health finanszírozza 6,2 millió dolláros támogatással, amely 2026. szeptember 17-ig tart.
USC Viterbi (AI): AI Gives Medical Advice Every Day. Who’s Checking Whether It’s Safe?


