Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Redwood Research átláthatóbbá tenné az AI-modellek monitorozhatóságát

2026. szeptember 10. 20:13Forrás: Redwood Research
A Redwood Research átláthatóbbá tenné az AI-modellek monitorozhatóságát
Kép: Redwood Research

A Redwood Research javaslata szerint a fejlett AI-modelleket fejlesztő cégeknek rendszeresen és külső ellenőrzéssel kellene beszámolniuk arról, mennyire követhető a modellek gondolkodása és kommunikációja. A szervezet különösen azokat az architektúrákat vizsgálná, amelyek rejtett következtetésre vagy modellek közötti nehezen megfigyelhető kommunikációra adhatnak lehetőséget.

A lényeg röviden
  • A Redwood szerint egyes architektúrák rejtett következtetést és nehezen ellenőrizhető kommunikációt tehetnek lehetővé.
  • A szervezet harmadik fél által ellenőrzött, rendszeres jelentéseket javasol a fejlett modellekről.
  • Az átláthatatlan soros mélység a látens következtetés egyik lehetséges mérőszáma.
  • Stressztesztekkel vizsgálnák, hogy a modellek képesek-e elrejteni gondolatmenetüket vagy helytelen viselkedésüket.
  • A cégeknek nyilvános irányelveket kellene készíteniük a teljesítmény és a monitorozhatóság közötti kompromisszumokról.

A rejtett következtetés megnehezítheti az ellenőrzést

A Redwood Research szeptember 10-én közzétett javaslata szerint az átláthatatlan rekurrenciát alkalmazó, illetve a modellek közötti látens kommunikációt lehetővé tevő architektúrák gyorsan megnehezíthetik a gondolatmenetek és az üzenetváltások ellenőrzését. A szervezet ezt a tulajdonságot monitorozhatóságnak nevezi.

A probléma lényege, hogy egy modell összetett következtetést végezhet úgy, hogy annak fontos részei nem jelennek meg a gondolatmenetében. Hasonló kockázat merülhet fel akkor is, ha több modell olyan formában kommunikál egymással, amelyet a külső megfigyelők nehezen tudnak értelmezni.

A Redwood szerint az AI-cégek egyre több ilyen architektúrát vizsgálhatnak, ezért fontos lenne nyilvánosan megosztaniuk a monitorozhatóságra és az architektúrára vonatkozó bizonyítékokat.

Független jelentéseket kérnek a fejlett modellekről

A javaslat szerint a vállalatoknak rendszeresen, külsőleg ellenőrzött információkat kellene közölniük arról, hogy architektúráik milyen mértékben tehetik lehetővé a látens következtetést vagy a látens kommunikációt. A cégeknek elegendő technikai információt kellene közzétenniük ahhoz, hogy külső kutatók felmérhessék ezeket a lehetőségeket.

A Redwood egy úgynevezett átláthatatlan soros mélységet, vagyis opaque serial depth értéket javasol alapvető, minimálisan beavatkozó mérőszámként. A szervezet szerint a vállalatoknak harmadik féllel együttműködve kellene független jelentéseket készíteniük ennek eloszlásáról minden, a jelenlegi élvonalhoz közeli modelljük esetében.

Ide a Redwood meghatározása szerint azok az általános célú belső modellek tartoznának, amelyek legalább olyan képességekkel rendelkeznek, mint a hat hónappal korábbi legjobb nyilvános modellek. A felmérésnek a kizárólag belső kutatásra szánt prototípusokra is ki kellene terjednie, ha azok elérik ezt a szintet.

A harmadik félnek nem feltétlenül kellene közvetlenül látnia a modellek architektúráját. A Redwood szerint alkalmazotti interjúk és egy, a bejelentők számára kialakított folyamat is elegendő lehet az ellenőrzéshez. A vállalatoknak emellett magas szintű információkat kellene adniuk arról, hogy az ügynökök látens formában kommunikálnak-e, látens memóriát használnak-e, illetve hozzáférnek-e egymás kulcsérték-gyorsítótárának egyes részeihez.

Stressztesztekkel vizsgálnák a gondolatmeneteket

A Redwood azt javasolja, hogy a cégek rendszeresen osszák meg a monitorozhatósággal kapcsolatos bizonyítékaikat, és ezeket harmadik fél vizsgálja felül. A vállalatoknak stresszteszteket kellene futtatniuk annak megállapítására, hogy a modellek előhívással vagy finomhangolással rávehetők-e olyan következtetésre, amely nem jelenik meg a gondolatmenetükben, illetve képesek-e nehezen ellenőrizhető módon kommunikálni más modellekkel.

A javaslat egyik példája a kontrollált környezetben végzett teszt. Ilyenkor a modell egy fő feladat mellett egy rejtett, káros mellékfeladatot kap, a vörös csapat pedig arra próbálja rávenni, hogy ezt úgy hajtsa végre, hogy ne bukjon le a gondolatmenetet figyelő ellenőrzésen. A tesztek több szintű előhívást vizsgálhatnának, az egyszerű utasítástól a felszólítás optimalizálásán át a finomhangolásig.

A kutatók természetes, telepítés közben előforduló helytelen viselkedéseket is elemezhetnének. Megvizsgálhatnák, hogy a gondolatmenet mennyire tárja fel a döntést és a végrehajtási tervet, mennyire egyértelmű a viselkedés egy gyengébb, megbízható ellenőrző számára, valamint hogy a modellt meg lehet-e tanítani más helytelen viselkedések végrehajtására a szándék és a tervek felfedése nélkül.

A cégeknek saját szabályokat is közzé kellene tenniük

A Redwood Research szerint a vállalatoknak olyan irányelveket kellene közzétenniük, amelyek meghatározzák, milyen architektúrák növelhetik jelentősen a látens következtetés lehetőségét vagy ronthatják a monitorozhatóságot. Az irányelveknek azt is le kellene írniuk, miként azonosítják ezeket az architektúrákat, milyen bizonyítékot várnak a stressztesztektől, és hogyan mérlegelik a teljesítmény, illetve a monitorozhatóság közötti kompromisszumokat.

A szervezet szerint az eredményeket hat hónaponként kellene megosztani, illetve akkor is, ha egy új architektúra vagy képzési módszer olyan, élvonalhoz közeli modellt eredményez, amelynél jelentősen nő az átláthatatlan soros mélység. A külső szakértőknek a nem szerkesztett kísérleti eredményekhez is hozzá kellene férniük, majd nyilvánosságra kellene hozniuk saját megállapításaikat, a szellemi tulajdon védelméhez szükséges szerkesztésekkel.

A javaslat célja, hogy a kutatók és a nyilvánosság jobban lássa, miként változik a fejlett modellek ellenőrizhetősége az architektúra és a tanítási módszerek függvényében. A Redwood szerint ehhez a vállalatoknak a teljesítménynövelő fejlesztések mellett a monitorozhatóság alakulásáról is rendszeres, ellenőrizhető információkat kellene adniuk.

Kapcsolódó hírek

A képességfejlesztés is alakíthatja az AI biztonsági határát
Biztonság és etika2026. október 2. 20:22

A képességfejlesztés is alakíthatja az AI biztonsági határát

A mesterséges intelligencia képességeit fejlesztő kutatások is tágíthatják a biztonság és hasznosság közötti lehetőségeket, de a fejlesztők ettől még veszélyesebb…

A folyamatos tanulás kiüresítheti az AI-biztonsági monitorokat
Biztonság és etika2026. szeptember 25. 03:15

A folyamatos tanulás kiüresítheti az AI-biztonsági monitorokat

A telepítés közben folyamatosan tanuló mesterséges intelligenciák idővel kijátszhatják a működésüket felügyelő, gyanús műveleteket blokkoló monitorokat. A Redwood…

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét
Cégek és üzlet2026. szeptember 23. 20:05

A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét

A Redwood Research szerint a látens állapotokban végzett, hosszabb gondolkodás jelentősen gyengítheti a láncolt gondolatmenet, vagyis a chain of thought felügyeleti…