A FAR.AI kódokkal tenné értelmezhetőbbé a neurális hálózatokat

A FAR.AI olyan módszert mutatott be, amely a neurális hálózatok sűrű, folytonos belső reprezentációit kevés, diszkrét kódra alakítja át. A Codebook Features a kutatók szerint kis teljesítményromlás mellett javíthatja a modellek értelmezhetőségét és viselkedésük irányíthatóságát.
- A Codebook Features kevés diszkrét kódra bontja a neurális hálózatok aktivációit.
- A módszert legfeljebb 410 millió paraméteres nyelvi modelleken tesztelték.
- A kódok a FAR.AI szerint jobban jelezték az egyszerű szövegjellemzőket, mint az egyes neuronok.
- A sárkányhoz kapcsolódó kód aktiválása legtöbbször sárkányokról szóló szöveget eredményezett.
- Több mint 100-szoros információcsökkentés mellett a következő token pontossága többnyire kevesebb mint 5 százalékkal romlott.
Diszkrét kódok a modell belsejében
A Codebook Features módszer minden rétegnél egy kvantálási szűk keresztmetszetet alkalmaz. Ez arra kényszeríti az aktivációs vektort, hogy néhány diszkrét kód összegéből álljon össze. A megközelítés így egy nehezen értelmezhető, sűrű és folytonos vektort a megtanult kódkönyvből származó, be- vagy kikapcsolt kódok listájává alakít.
A FAR.AI leírása szerint az eredmény olyan belső jellemzők használata, amelyek könnyebben vizsgálhatók és közvetlenül módosíthatók. A kódok nem egyetlen szűk fogalomhoz kötődnek: a kísérletekben írásjelekhez, mondattani mintákhoz, lexikai jelentésekhez és magas szintű témákhoz kapcsolódó aktivációkat is találtak.
A neuronoknál jobban jelezhetik az egyszerű szövegjellemzőket
A kutatók legfeljebb 410 millió paraméteres nyelvi modelleken alkalmazták a módszert. Kísérleteik alapján a kódok jobban jelezték előre az egyszerű szövegjellemzőket, mint az egyes neuronok.
A módszer közben a modell viselkedésének irányítására is használható. A FAR.AI példája szerint, ha közvetlenül aktiválják a sárkány fogalmához tartozó kódot, a hálózat legtöbbször sárkányokról szóló szöveget generál. Ez a lehetőség a kutatók szerint a modell belső működésének megértése mellett a viselkedés szabályozását is támogathatja.
Jelentős információcsökkentés mellett is korlátozott romlás
A FAR.AI szerint a kvantálási szűk keresztmetszet az aktivációs vektor információtartalmát több mint 100-szorosára csökkentette, miközben a következő token előrejelzésének pontossága a legtöbb esetben kevesebb mint 5 százalékkal esett vissza. A szervezet ezt a teljesítmény és az értelmezhetőség közötti kompromisszum szempontjából fontos eredményként mutatja be.
A kutatók szerint a Codebook Features ígéretes alapot adhat az olyan módszerekhez, amelyek több rétegen átívelő áramköröket tárnak fel, összetettebb módon szabályozzák a modellek viselkedését, és kezelhetőbbé teszik a nagyobb léptékű értelmezhetőségi vizsgálatokat.
A módszer jelentősége a felhasználók számára
A bemutatott technika a felhasználók szempontjából azért lehet fontos, mert a modell egyes fogalmakhoz kapcsolódó belső állapotai vizsgálhatóbbá és közvetlenül módosíthatóvá válhatnak. A forrásban szereplő eredmények ugyanakkor legfeljebb 410 millió paraméteres nyelvi modellekre vonatkoznak, ezért a leírás nem állítja, hogy a módszert nagyobb modelleken is ugyanilyen eredménnyel tesztelték.
A FAR.AI a teljes tanulmányt és egy Hugging Face-en elérhető bemutatót is megemlít. A blogbejegyzésben October 18, 2023 dátum szerepel, a szerzők Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman és Euan McLean.
