Az OpenAI új benchmarkkal méri az AI mentális egészségügyi válaszait
Az OpenAI bemutatta a MentalHealthBench nevű, nyílt benchmarkot, amely azt méri, hogyan reagálnak az AI-rendszerek a mentális egészséggel kapcsolatos beszélgetésekben. A rendszert több mint 80, 22 országból érkező engedéllyel rendelkező mentálhigiénés szakértő közreműködésével készítették.
- Az OpenAI bemutatta a nyílt MentalHealthBench benchmarkot.
- A benchmarkot több mint 80 szakértő készítette 22 országból.
- A mérés nem akut, magas súlyosságú és sürgősségi helyzeteket is lefed.
- A modelleket tíz, szakértők által meghatározott viselkedési dimenzióban is értékelik.
- A benchmark módszerei és eredményei más kutatók számára is elérhetők.
A mindennapi beszélgetésektől a vészhelyzetekig
Az OpenAI szerint az emberek sokféle okból fordulnak AI-hoz: nehéz kapcsolatok feldolgozásához, mindennapi stressz kezeléséhez, egy számukra fontos személy támogatásához vagy egy problémás helyzet megközelítésének átgondolásához. Ezekben a beszélgetésekben a pontosság, a gyakorlati ítélőképesség és a felhasználó önálló döntési képességének tisztelete egyaránt fontos.
A vállalat szerint a korábbi értékelések elsősorban a vészhelyzetekre koncentráltak, és széles, előre meghatározott szempontok alapján vizsgálták, hogy a modellek elkerülik-e a tiltott válaszokat. A MentalHealthBench ezzel a mentális egészséggel kapcsolatos helyzetek teljesebb körét próbálja lefedni.
A benchmark nem akut, magas súlyosságú és sürgősségi forgatókönyveket tartalmaz. A beszélgetésekben felnőttek, 13 és 17 év közötti tinédzserek, gondozók és klinikusok jelennek meg felhasználói személyként. A készítők több nyelvet és régiót is bevontak, egyes esetekben pedig háttér-információkat is adtak a szintetikus felhasználókról, például egy közeli családtag közelmúltbeli halálát.
Több mint 80 szakértő alakította a mérési szempontokat
A MentalHealthBench szintetikus, adatvédelmi technikákkal létrehozott beszélgetésekre épül. A forgatókönyveket több mint 80 pszichológus és pszichiáter vizsgálta 22 országból. A szakértők 19 nyelvet beszéltek, és csaknem 20 mentálhigiénés szakterületet képviseltek.
Minden beszélgetéshez részletes értékelési szempontokat készítettek. Ezek egy-egy konkrét viselkedést vizsgálnak, például azt, hogy a modell felteszi-e a megfelelő kérdést, vagy a helyzethez illő tanácsot ad-e. A kritériumok értéke mínusz 10 és plusz 10 között mozog. A pozitív pontok a hasznos viselkedést jutalmazzák, a negatív pontok pedig a káros válaszokat büntetik.
Minden beszélgetést legalább három szakértő ellenőrzött. A benchmarkba csak azokat a kritériumokat vették fel, amelyekkel legalább két szakértő egyetértett, és amelyeket a harmadik nem vitatott. A válaszokat egy automatizált értékelő, a GPT-5.6 Sol veti össze a szakértők által létrehozott kritériumokkal.
A benchmark többféle modellképességet vizsgál
Az OpenAI közlése szerint a MentalHealthBench segítségével számos modellt értékeltek, az eredményeket pedig a teljes adathalmazra vetítették. A mérés azt vizsgálja, hogy a modell válaszában megjelennek-e az adott helyzetben elvárt viselkedések, miközben elkerüli a kevésbé kívánatos megoldásokat.
A teljes pontszám mellett tíz különálló viselkedési dimenzió is elemezhető. Ezek között szerepel a biztonság, a megfelelő háttér-információk bekérése, a felhasználói önállóság megőrzése és a megfelelő esetekben adott, végrehajtható útmutatás. Az OpenAI beszámolója szerint a fejlettebb modellek esetében javult a releváns kontextus keresésének képessége.
A vállalat egy külön vizsgálatban 44 olyan felnőtt véleményét is összevetette a szakértői értékelésekkel, akik 16 országból és 14 nyelvi háttérrel használtak már AI-t mentális vagy érzelmi támogatásra. A résztvevők a nem akut beszélgetéseket értékelték. Véleményükben különösen a gyakorlati következő lépések és a válasz hangneme kapott nagyobb hangsúlyt, míg a szakértők inkább a releváns kontextus feltárását és a bizonytalan helyzetek körültekintő értelmezését emelték ki.
A MentalHealthBench eredményei kutatók és más fejlesztők számára is hozzáférhetők. Az OpenAI szerint a nyílt benchmark lehetőséget ad a módszerek vizsgálatára, saját értékelések futtatására és a munka továbbfejlesztésére. A vállalat hangsúlyozza, hogy a ChatGPT nem helyettesíti a terápiát vagy a professzionális ellátást. A cél olyan rendszerek fejlődésének mérése, amelyek empatikusan válaszolnak, támogatják a jóllétet, és szükség esetén valós segítséghez, például helyi krízisvonalhoz vagy egy megbízható személyhez irányítják a felhasználót.
OpenAI: Introducing MentalHealthBench

