Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Így vizsgálnák, hogy biztonságosak-e a chatbotok orvosi tanácsai

2026. augusztus 26. 20:55Forrás: USC Viterbi (AI)
Így vizsgálnák, hogy biztonságosak-e a chatbotok orvosi tanácsai
Kép: USC Viterbi (AI)

Egy igaz állítás is veszélyes lehet, ha egy chatbot nem közli a szükséges figyelmeztetéseket. Az USC ALICE projektje olyan módszereket fejleszt, amelyekkel az orvosi válaszok pontosságát, teljességét és biztonságosságát vizsgálnák.

A lényeg röviden
  • Az ALICE az orvosi chatbot-válaszok pontosságát, teljességét és biztonságát vizsgálja.
  • A kutatók szerint fontos hibák és figyelmeztetések maradhatnak ki a válaszokból.
  • Az egyik automatikus módszer a valódi hiányosságok több mint 90 százalékát felismerte egy tesztben.
  • Az automatikus ellenőrzők jelenleg nem helyettesítik az orvosi szakértői döntést.
  • A projekt célja, hogy a jövőben független tanúsítás segítse a felhasználókat.

Egy helyes válasz is félrevezető lehet

Az USC Viterbi School of Engineering és az USC Stevens School for Computing and Artificial Intelligence ismertetése szerint egy anya azt kérdezi egy chatbot­tól, biztonságos-e a paracetamol a csecsemője számára. A rendszer igennel válaszol, de nem feltétlenül magyarázza el, hogy a csecsemőknek és a gyermekeknek szánt készítmények koncentrációja eltérhet, ezért az adagolásuk is más lehet.

Az ilyen válaszok kockázata, hogy a chatbot néhány másodperc alatt nyugodt és magabiztos hangnemben ad tanácsot, miközben tényt találhat ki, kisebbítheti egy sürgős helyzet jelentőségét, vagy kihagyhat egy fontos figyelmeztetést. A felhasználó emiatt késleltetheti az ellátást, rossz adagot vehet be, vagy olyan kezelést követhet, amely nem segít.

„Ha 90 százalékban helyes, mit teszünk?” idézi az USC Marjorie Freedmant, az USC Information Sciences Institute, vagyis az ISI mesterségesintelligencia-részlegének vezető kutatóját és társigazgatóját. Szerinte a fennmaradó 10 százalék „nagyon félrevezető” és akár káros is lehet.

Az ALICE nem egyetlen pontszámot keres

Freedman vezeti az ALICE nevű projektet, amelynek neve az Assessing LLM Integrity for Clinical Engagement rövidítése. A kutatásban Jonathan May, az USC Viterbi és az USC Stevens számítástechnikai tanszékének kutatóprofesszora, az ISI vezető kutatója és mesterségesintelligencia-részlegének igazgatója is részt vesz.

A projekt olyan eszközöket fejleszt, amelyek az orvosi kérdésekre adott chatbot-válaszokat vizsgálják. A cél a hamis állítások és a hiányzó információk felismerése, miközben azt is ellenőriznék, hogy a válasz érthető, hasznos és a beteg, a szülő vagy az egészségügyi szakember számára megfelelően sürgős hangvételű-e.

A kutatók az automatikus értékelők mellett emberi szakértők által ellenőrzött adatkészleteket is készítenek. Három chatbot több száz válaszát vizsgálták, amelyek között körülbelül 500 szavas szövegek is voltak. Az egyik vizsgálatban az első ellenőrzők gyakran nem vették észre a valódi hibákat, amelyeket később más értékelők, orvosi szakértők és hivatásos tényellenőrök azonosítottak.

A szakértők sem mindig értenek egyet

A későbbi szakértői ellenőrzés sem adott minden esetben egyértelmű választ. A szakértők időnként eltérően ítélték meg, hogy egy állítás valóban hibás-e. Amikor egy chatbotot további ellenőrként vontak be, több lehetséges hibát talált, mint az emberek, de olyan tévedéseket is kihagyott, amelyeket a humán értékelők felismertek.

„Nagyfokú árnyaltság kell annak megállapításához, mi az objektív igazság egy egyszerű állításban”, mondta May az USC beszámolója szerint. A forrás eredeti szövegében szereplő gondolatjel helyett magyar mondatszerkezetben: May szerint egy egyszerű állítás objektív igazságának meghatározása is rendkívül árnyalt feladat.

Egy másik vizsgálat az elhallgatott információkra összpontosított. Orvosi szakértők valódi betegkérdésekre adott válaszokat elemeztek, és megjelölték a hiányzó, fontos információkat. Három automatikus módszert teszteltek, közülük a legerősebb az egyik tesztkészletben a valódi hiányosságok több mint 90 százalékát megtalálta. Ugyanakkor sok téves riasztást is adott, ezért jelenleg inkább szakértői ellenőrzésre kijelölt válaszok szűrésére alkalmas, mint az orvosi döntés kiváltására.

A projekt független tanúsítást szeretne

Az ALICE kutatói szerint az orvosi chatbotok értékelésénél a pontosság és a teljesség mellett azt is vizsgálni kell, hogy a válasz közérthető magyarázatot, hasznos következő lépéseket és egyértelmű jelzést ad-e arról, ha sürgős ellátásra van szükség. A kutatócsoport az eredmények, az adatok és a módszerek megosztására készül, hogy mások is folytathassák a munkát a támogatási időszak után.

Freedman szerint továbbra is nehéz pontosan meghatározni, mitől teljes egy orvosi válasz. A chatbotokat ma sokan az alapján ítélik meg, mennyire kifinomult, világos vagy együttérző a szövegük, de ezek a tulajdonságok önmagukban nem bizonyítják, hogy a tanács megbízható.

May célja, hogy a független tesztelés erősebb alapot adjon a felhasználóknak annak eldöntéséhez, mely rendszerekben bízhatnak. A kutató szerint hasonló tanúsítást szeretnének biztosítani a magas kockázatú területeken, például az orvostudományban és az orvosi kérdéseknél. A két évre szóló projektet az Advanced Research Projects Agency for Health finanszírozza 6,2 millió dolláros támogatással, amely 2026. szeptember 17-ig tart.

Kapcsolódó hírek

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2. 20:07

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait
Biztonság és etika2026. október 1.

Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait

A Goodfire olyan biosecurity-monitorokat fejlesztett, amelyek fehérjemodellekből származó embeddingekkel vizsgálják az AI-ügynökök által kezelt biológiai szekvenciákat.…

Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire
Biztonság és etika2026. október 1.

Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire

A Goodfire olyan biztonsági monitorokat fejlesztett AI-ügynökökhöz, amelyek a fehérjeszekvenciák és a feladat kontextusa alapján mérik a biológiai kutatási feladatok…