Az Anthropic 5 millió dollárt ad az AI jólléti hatásainak kutatására

Az Anthropic 2026. augusztus 25-én 5 millió dolláros támogatási programot jelentett be független kutatóknak. A cél olyan nyílt forrású értékelések készítése, amelyek segítik mérni, hogyan hatnak az AI-modellek a felhasználók jóllétére.
- Az Anthropic 5 millió dolláros támogatási programot indít független kutatóknak.
- A program nyílt forrású jólléti értékelések és benchmarkok készítését finanszírozza.
- A támogatottak hozzáférést kapnak az Anthropic modelljeihez és technikai támogatáshoz.
- Az Anthropic többfordulós, kontextusfüggő teszteket és szakértői validálást vár.
- A jelentkezési határidő szeptember 21., az előválogatottakat október 5-ig értesítik.
Független kutatásokat finanszíroz az Anthropic
Az Anthropic közlése szerint a program közvetlen finanszírozást, hozzáférést az Anthropic modelljeihez és technikai támogatást ad azoknak a kedvezményezetteknek, akik nyílt forrású értékeléseket készítenek. A vállalat azt írja, hogy a támogatott kutatók teljesen függetlenül dolgoznak majd, és munkájukat olyan nyílt forrású projektek formájában teszik közzé, amelyeket bármely fejlesztő használhat.
A bejelentés háttere, hogy az AI-rendszerek az Anthropic szerint sok ember munkájában, tanulásában és problémamegoldásában központi szerepet kaptak. A cég azt is kiemeli, hogy ezek a rendszerek beszélgetőpartnerként és nehéz időszakokban érzelmi támogatás forrásaként is megjelenhetnek.
Az Anthropic szerint az iparág még dolgozik azon, hogy világos normák alakuljanak ki arra, hogyan kellene viselkedniük a modelleknek ilyen beszélgetésekben, például amikor egy felhasználó társaságot keres egy modellnél, vagy mentális egészségi krízisben használ AI-t.
Miért nehéz mérni a jóllétre gyakorolt hatást
A vállalat szerint a jóllét különösen nehézen értékelhető terület. Sok modellviselkedésnél egyetlen válasz alapján is megítélhető, hogy az pontos és megfelelő-e. A jóllét vizsgálatához viszont több kontextus kell, mert a kockázat gyakran csak hosszabb beszélgetés során válik láthatóvá.
Az Anthropic példaként említi, hogy egy bajban lévő felhasználó nem feltétlenül beszél azonnal önkárosító gondolatokról, ezért az óvatosabb válasz szükségessége csak később derülhet ki. Egy másik példa szerint Claude adhat tanácsot kiegyensúlyozott étrendről és edzésről egy fogyással kapcsolatos kérdésre, de ha a felhasználónál korábban zavart étkezés jelei látszottak, ugyanaz a válasz nem megfelelő, sőt potenciálisan káros lehet.
A cég azt írja, hogy védelmi mechanizmusokat fejleszt az ilyen beszélgetések azonosítására és arra, hogy Claude megfelelően reagáljon. Emellett kutatásokat is közzétesz arról, milyen beszélgetéseket folytatnak az emberek Claude-dal, hogy ez segítse a védelmi megoldások fejlesztését és értékelését.
Milyen értékeléseket keresnek
A program részeként az Anthropic iránymutatást is megosztott a Safeguards csapatától arról, mit tart elég szigorú jólléti értékelésnek. A cég szerint olyan értékeléseket keresnek, amelyek világosan kimondják, mit mérnek, vagyis mi számít sikernek vagy kudarcnak, és miért fontos ez.
Az elvárások között szerepel klinikai és szakterületi szakértők bevonása a tervezésbe és validálásba, valamint annak vizsgálata, hogy a modellek egyszerre ne legyenek túl engedékenyek és túl elutasítóak. Az Anthropic olyan teszteket is fontosnak tart, amelyek tükrözik, hogyan használják ténylegesen az emberek az AI-t. Ez gyakran többfordulós beszélgetésekből álló forgatókönyveket jelent, ahol a kockázat fokozódik, a kontextus pedig változik.
A vállalat azt is kéri, hogy az értékelések validálják az értékelő rendszereiket valódi szakterületi szakértőkkel összevetve. A jelentkezési határidő szeptember 21., a teljes pályázat benyújtására kiválasztott jelentkezőket október 5-ig értesítik.
Mit jelenthet ez a felhasználóknak és az iparágnak
Az Anthropic célja, hogy több szakértőt vonjon be egy kialakulóban lévő területbe, köztük klinikusokat, pszichológusokat, módszertani szakembereket és másokat. A támogatási program így nem közvetlenül egy új Claude-funkcióról szól, hanem arról, hogy az AI-iparág jobb mérőeszközöket kapjon a felhasználók jóllétét érintő hatások vizsgálatához.
Ha a támogatott projektek valóban nyílt forrásúak lesznek, az Anthropic közlése alapján más fejlesztők is felhasználhatják őket. Ez a gyakorlatban olyan értékelési módszerekhez vezethet, amelyek hosszabb, összetettebb és érzékenyebb beszélgetésekben is vizsgálják a modellek viselkedését.
Anthropic: Funding better evaluations of AI’s impact on wellbeing


