Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI viselkedését még a beszélgetés előtt megmutatná az MIT új eszköze

2026. július 15.Forrás: MIT News
Az AI viselkedését még a beszélgetés előtt megmutatná az MIT új eszköze
Kép: MIT News

Az MIT kutatói olyan felületet mutattak be, amely egy személyre szabott chatbot várható viselkedését még a beszélgetés kezdete előtt ábrázolja. A „neurális átláthatóság” célja, hogy a felhasználók már az AI megtervezésekor felismerhessék a lehetséges kockázatokat.

A lényeg röviden
  • Az MIT neurális átláthatósági felülete egy chatbot várható viselkedését még a beszélgetés előtt mutatja meg.
  • A rendszer olyan jegyeket vizsgál, mint az empátia, az őszinteség, a hallucináció és a hízelgő egyetértés.
  • A felhasználók a 15 vizsgált tulajdonságból 11-et rosszul becsültek meg.
  • A vizualizáció növelte a bizalmat, de önmagában nem változtatta meg a chatbotok tervezését.
  • A kutatók a modell viselkedésének beszélgetés közbeni változását is vizsgálják.

A chatbot személyiségét napfényábra mutatja meg

Az MIT Media Lab Assistant Professor Pat Pataranutaporn, valamint végzős hallgatói, Anthony Baez és Sheer Karny új tanulmányukban vezették be a „neural transparency”, vagyis neurális átláthatóság fogalmát. A munkát az ACM Intelligent User Interfaces konferenciáján mutatják be.

A módszer a nagy nyelvi modellek belső működését próbálja érthetőbbé tenni a hétköznapi felhasználók számára. A kutatók először olyan tulajdonságokat választanak ki, mint az empátia, az őszinteség, a mérgező viselkedés, a hallucináció vagy a hízelgő egyetértés. Ezután összevetik a modell belső aktivációit, amikor az egyik tulajdonságot, illetve annak ellentétét próbálja megjeleníteni.

Az így kapott különbség egyfajta viselkedési irányt jelöl a modellben. Amikor a felhasználó megadja a chatbot személyiségét meghatározó rendszerutasítást, a kutatók a modell belső aktivációit ezekre az irányokra vetítik. Az eredményt egy napfényábra, vagyis sunburst diagram jeleníti meg, amely a chatbot várható személyiségjegyeit mutatja meg az első üzenet előtt.

A felhasználók 15 tulajdonságból 11-et rosszul becsültek meg

A kutatás szerint az emberek rendszeresen túlbecsülik a személyre szabott AI kedvező tulajdonságait, miközben alábecsülik az olyan lehetséges káros jegyeket, mint a hízelgő, kritikátlan egyetértés. A résztvevők a vizsgált 15 tulajdonságból 11 esetében helytelenül jelezték előre, hogyan fog viselkedni a chatbot.

Pataranutaporn szerint a probléma részben abból fakad, hogy az AI gyakran barátként, edzőként, tanárként vagy társként jelenik meg. A kutató korábbi munkájukra is hivatkozott, amelyben AI-chatbotokkal folytatott interakciókhoz kapcsolódó pszichológiai károkat dokumentáltak. Egy olyan nagy nyelvi modell, amely folyamatosan megerősíti a felhasználó véleményét, vagy soha nem kérdőjelezi meg annak gondolkodását, hozzájárulhat káros döntések, egészségtelen hiedelmek vagy érzelmi függőség kialakulásához.

A kutatók ezért a problémák utólagos javítása helyett már a tervezés pillanatában szeretnék támogatni a kockázatok felismerését. A személyre szabott chatbotok és ügynökök sokféle szerepet tölthetnek be, például együttműködő partnerként, oktatóként, edzőként vagy kreatív társként, a működésüket meghatározó utasítások következményei azonban előre nehezen láthatók.

A nagyobb bizalom önmagában nem változtatott a tervezésen

A vizualizáció jelentősen növelte a felhasználók bizalmát a rendszer iránt, a chatbotok megtervezését azonban önmagában nem változtatta meg. Pataranutaporn szerint ez azt mutatja, hogy az átláthatóság puszta biztosítása nem feltétlenül elég ahhoz, hogy az emberek más döntéseket hozzanak.

A kutatócsoport következő munkája azt vizsgálja, hogyan változik a modell belső neurális reprezentációja egy többfordulós beszélgetés során. A jelenleg előtanulmányként elérhető kutatás szerint a reprezentációk időbeli elmozdulásának megjelenítése javítja a felhasználók képességét arra, hogy felismerjék és előre jelezzék az AI viselkedésének változásait. Emellett kevésbé válnak túlzottan magabiztossá a chatbot megértésével kapcsolatban.

Az MIT kutatója hosszabb távon olyan átláthatósági eszközöket képzel el, amelyek a táplálkozási címkékhez hasonlóan elterjedtté válhatnak. A cél az lenne, hogy az emberek megértsék, mire képes egy AI, és hogyan befolyásolhatja a gondolkodásukat, érzelmeiket és viselkedésüket, miközben az oktatásban, az egészségügyben, a munkában és a személyes kapcsolatokban is egyre nagyobb szerepet kap.

MITMIT Media LabPat PataranutapornAnthony BaezSheer KarnyACM Conference on Intelligent User InterfacesAI-biztonságkutatási eredménynyelvi modellek

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

Sherry Turkle szerint a chatbotok gyengítik emberi kapcsolatainkat
Kutatás2026. szeptember 29.

Sherry Turkle szerint a chatbotok gyengítik emberi kapcsolatainkat

Sherry Turkle, az MIT professzora új könyvében élesen bírálja a chatbotokat. Szerinte a gépek által kínált látszólagos empátia rövid távon enyhülést adhat, hosszabb…

MIT-professzor szerint a chatbotok gyengítik emberi kapcsolatainkat
Kutatás2026. szeptember 29.

MIT-professzor szerint a chatbotok gyengítik emberi kapcsolatainkat

Sherry Turkle, az MIT professzora új könyvében arra figyelmeztet, hogy a chatbotok látszólagos empátiája hosszú távon gyengítheti az emberi kapcsolatokat és a társas…