Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI új benchmarkkal méri az AI mentális egészségügyi válaszait

2026. szeptember 23. 12:00Forrás: OpenAI

Az OpenAI bemutatta a MentalHealthBench nevű, nyílt benchmarkot, amely azt méri, hogyan reagálnak az AI-rendszerek a mentális egészséggel kapcsolatos beszélgetésekben. A rendszert több mint 80, 22 országból érkező engedéllyel rendelkező mentálhigiénés szakértő közreműködésével készítették.

A lényeg röviden
  • Az OpenAI bemutatta a nyílt MentalHealthBench benchmarkot.
  • A benchmarkot több mint 80 szakértő készítette 22 országból.
  • A mérés nem akut, magas súlyosságú és sürgősségi helyzeteket is lefed.
  • A modelleket tíz, szakértők által meghatározott viselkedési dimenzióban is értékelik.
  • A benchmark módszerei és eredményei más kutatók számára is elérhetők.

A mindennapi beszélgetésektől a vészhelyzetekig

Az OpenAI szerint az emberek sokféle okból fordulnak AI-hoz: nehéz kapcsolatok feldolgozásához, mindennapi stressz kezeléséhez, egy számukra fontos személy támogatásához vagy egy problémás helyzet megközelítésének átgondolásához. Ezekben a beszélgetésekben a pontosság, a gyakorlati ítélőképesség és a felhasználó önálló döntési képességének tisztelete egyaránt fontos.

A vállalat szerint a korábbi értékelések elsősorban a vészhelyzetekre koncentráltak, és széles, előre meghatározott szempontok alapján vizsgálták, hogy a modellek elkerülik-e a tiltott válaszokat. A MentalHealthBench ezzel a mentális egészséggel kapcsolatos helyzetek teljesebb körét próbálja lefedni.

A benchmark nem akut, magas súlyosságú és sürgősségi forgatókönyveket tartalmaz. A beszélgetésekben felnőttek, 13 és 17 év közötti tinédzserek, gondozók és klinikusok jelennek meg felhasználói személyként. A készítők több nyelvet és régiót is bevontak, egyes esetekben pedig háttér-információkat is adtak a szintetikus felhasználókról, például egy közeli családtag közelmúltbeli halálát.

Több mint 80 szakértő alakította a mérési szempontokat

A MentalHealthBench szintetikus, adatvédelmi technikákkal létrehozott beszélgetésekre épül. A forgatókönyveket több mint 80 pszichológus és pszichiáter vizsgálta 22 országból. A szakértők 19 nyelvet beszéltek, és csaknem 20 mentálhigiénés szakterületet képviseltek.

Minden beszélgetéshez részletes értékelési szempontokat készítettek. Ezek egy-egy konkrét viselkedést vizsgálnak, például azt, hogy a modell felteszi-e a megfelelő kérdést, vagy a helyzethez illő tanácsot ad-e. A kritériumok értéke mínusz 10 és plusz 10 között mozog. A pozitív pontok a hasznos viselkedést jutalmazzák, a negatív pontok pedig a káros válaszokat büntetik.

Minden beszélgetést legalább három szakértő ellenőrzött. A benchmarkba csak azokat a kritériumokat vették fel, amelyekkel legalább két szakértő egyetértett, és amelyeket a harmadik nem vitatott. A válaszokat egy automatizált értékelő, a GPT-5.6 Sol veti össze a szakértők által létrehozott kritériumokkal.

A benchmark többféle modellképességet vizsgál

Az OpenAI közlése szerint a MentalHealthBench segítségével számos modellt értékeltek, az eredményeket pedig a teljes adathalmazra vetítették. A mérés azt vizsgálja, hogy a modell válaszában megjelennek-e az adott helyzetben elvárt viselkedések, miközben elkerüli a kevésbé kívánatos megoldásokat.

A teljes pontszám mellett tíz különálló viselkedési dimenzió is elemezhető. Ezek között szerepel a biztonság, a megfelelő háttér-információk bekérése, a felhasználói önállóság megőrzése és a megfelelő esetekben adott, végrehajtható útmutatás. Az OpenAI beszámolója szerint a fejlettebb modellek esetében javult a releváns kontextus keresésének képessége.

A vállalat egy külön vizsgálatban 44 olyan felnőtt véleményét is összevetette a szakértői értékelésekkel, akik 16 országból és 14 nyelvi háttérrel használtak már AI-t mentális vagy érzelmi támogatásra. A résztvevők a nem akut beszélgetéseket értékelték. Véleményükben különösen a gyakorlati következő lépések és a válasz hangneme kapott nagyobb hangsúlyt, míg a szakértők inkább a releváns kontextus feltárását és a bizonytalan helyzetek körültekintő értelmezését emelték ki.

A MentalHealthBench eredményei kutatók és más fejlesztők számára is hozzáférhetők. Az OpenAI szerint a nyílt benchmark lehetőséget ad a módszerek vizsgálatára, saját értékelések futtatására és a munka továbbfejlesztésére. A vállalat hangsúlyozza, hogy a ChatGPT nem helyettesíti a terápiát vagy a professzionális ellátást. A cél olyan rendszerek fejlődésének mérése, amelyek empatikusan válaszolnak, támogatják a jóllétet, és szükség esetén valós segítséghez, például helyi krízisvonalhoz vagy egy megbízható személyhez irányítják a felhasználót.

Kapcsolódó hírek

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát
Fejlesztőknek2026. október 1. 16:02

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát

Az Arize AI az Alyx AI-mérnöki ügynök hosszú távú memóriáját egyetlen, strukturált szövegfájlra építette fel felhasználónként és Arize space-enként. A vállalat szerint…

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját
Fejlesztőknek2026. október 1. 16:02

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját

Az Arize AI egy strukturált szövegfájlra egyszerűsítette Alyx, az Arize AX mesterségesintelligencia-mérnöki ügynökének hosszú távú memóriáját. A cég szerint a megoldás…

Biztonság és etika
Biztonság és etika2026. szeptember 30. 12:30

Az OpenAI leállított egy nagyszabású modelllepárlási kampányt

Az OpenAI leállított egy összehangolt kampányt, amely modelljeinek védett következtetéseit próbálta nagy léptékben kinyerni. A vállalat szerint a tevékenység egy…