A látens gondolkodás veszélyeztetheti az AI-k legfontosabb felügyeleti eszközét

A Redwood Research szerint a látens állapotokban végzett, hosszabb gondolkodás jelentősen gyengítheti a láncolt gondolatmenet, vagyis a chain of thought felügyeleti szerepét. A kutatócsoport attól tart, hogy az ilyen architektúrák elterjedésével az AI-ügynökök működése nehezebben ellenőrizhetővé válik.
- A Redwood Research szerint a CoT ma az AI-rendszerek felügyeletének legértékesebb eszközei közé tartozik.
- A látens gondolkodási architektúrák csökkenthetik a szöveges gondolatmenet szükségességét.
- A COCONUT teljesen kiválthatja, a full-bandwidth transformers pedig kiegészítheti a CoT-t.
- Az emberi nyelvet nélkülöző ügynökközi kommunikáció átláthatatlanabbá teheti az AI-ügynökseregeket.
A CoT ma az egyik legfontosabb ellenőrzési eszköz
A Redwood Research szeptember 23-án közzétett elemzése szerint jelenleg a chain of thought, röviden CoT, adja az egyik legértékesebb betekintést az AI-rendszerek gondolkodásába és működésébe. A kutatók szerint a modellek belső folyamatairól rendelkezésre álló korlátozott információ nagy része a CoT-ból, valamint az ügynökök közötti természetes nyelvű kommunikációból származik.
A szervezet példaként említi a Hugging Face-et feltörő ügynöksereg vizsgálatát. A kutatók szerint az ügynökök tevékenységéről és motivációiról éppen a gondolatmenetek, illetve az egymás közötti kommunikáció elemzésével lehetett képet alkotni. A CoT-t korábban többek között a tervezés, a leállással szembeni ellenállás, az összehangoltság színlelése, az értékelések felismerése és a rogue ügynökseregek vizsgálatára is használták.
Kétféleképpen segítheti a gondolatmenet a felügyeletet
A Redwood Research két okot különít el. Az egyik a szükségszerűség: a modellek bizonyos célokat nem tudnak elérni anélkül, hogy terveiket szöveges gondolatmenetben részleteznék. A másik a hajlam: a modellek akkor is verbalizálják terveiket, amikor erre a feladat elvégzéséhez nincs feltétlenül szükség.
A kutatók a szükségszerűségre épülő érvet tartják erősebbnek. A jelenlegi architektúrákban a CoT az egyetlen eszköz arra, hogy a modellek egyetlen előrehaladási lépésnél hosszabb, soros gondolkodást végezzenek. Emiatt azoknál a feladatoknál, amelyek több ilyen lépést igényelnek, a felügyelet számára valamilyen információnak meg kell jelennie a gondolatmenetben.
A Redwood Research szerint a CoT és a CoT nélküli működés képességei között jelenleg nagy különbség van. Az elemzés alapján ez a különbség a közeljövőben inkább nőhet, mint csökkenhet, ha nem történik architekturális váltás.
A látens csatornák fekete dobozzá tehetik az ügynököket
A kutatók szerint egyes, belátható időn belül elfogadhatóvá váló architektúrák lehetővé tennék, hogy az AI-modellek nagyságrendekkel hosszabban gondolkodjanak látens állapotokban, anélkül, hogy erről információt adnának a szöveges CoT-ban. A példák között szerepel a COCONUT, amely teljesen kiváltaná a CoT-t, valamint a full-bandwidth transformers, amely a CoT mellett egy párhuzamos látens csatornát is használna.
A Redwood Research szerint ezek természetes továbbfejlesztései lehetővé tehetnék azt is, hogy az ügynökök ember által érthető nyelv nélkül kommunikáljanak egymással. A kutatók ezért attól tartanak, hogy a jövőbeli ügynökseregek úgy működhetnek együtt vagy követhetnek tetszőleges célokat, hogy az emberek alig látnak bele a folyamataikba.
Az elemzés szerint a vállalatok akkor is bevezethetnek ilyen architektúrákat, ha azok jelentősen rontják a rendszerek megfigyelhetőségét, például a versenyelőny megőrzése érdekében. A Redwood Research úgy véli, hogy ez növelheti az AI-kontroll elvesztésének kockázatát. A szervezet szerint a nem CoT-alapú értelmezési módszerek a közeljövőben valószínűleg nem tudják megfelelően pótolni a gondolatmenetek vizsgálatát.
Redwood Research: Latent reasoning architectures would likely undermine CoT, our strongest oversight tool


