Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI kódokkal tenné értelmezhetőbbé a neurális hálózatokat

2026. július 16.Forrás: FAR.AI
A FAR.AI kódokkal tenné értelmezhetőbbé a neurális hálózatokat
Kép: FAR.AI

A FAR.AI olyan módszert mutatott be, amely a neurális hálózatok sűrű, folytonos belső reprezentációit kevés, diszkrét kódra alakítja át. A Codebook Features a kutatók szerint kis teljesítményromlás mellett javíthatja a modellek értelmezhetőségét és viselkedésük irányíthatóságát.

A lényeg röviden
  • A Codebook Features kevés diszkrét kódra bontja a neurális hálózatok aktivációit.
  • A módszert legfeljebb 410 millió paraméteres nyelvi modelleken tesztelték.
  • A kódok a FAR.AI szerint jobban jelezték az egyszerű szövegjellemzőket, mint az egyes neuronok.
  • A sárkányhoz kapcsolódó kód aktiválása legtöbbször sárkányokról szóló szöveget eredményezett.
  • Több mint 100-szoros információcsökkentés mellett a következő token pontossága többnyire kevesebb mint 5 százalékkal romlott.

Diszkrét kódok a modell belsejében

A Codebook Features módszer minden rétegnél egy kvantálási szűk keresztmetszetet alkalmaz. Ez arra kényszeríti az aktivációs vektort, hogy néhány diszkrét kód összegéből álljon össze. A megközelítés így egy nehezen értelmezhető, sűrű és folytonos vektort a megtanult kódkönyvből származó, be- vagy kikapcsolt kódok listájává alakít.

A FAR.AI leírása szerint az eredmény olyan belső jellemzők használata, amelyek könnyebben vizsgálhatók és közvetlenül módosíthatók. A kódok nem egyetlen szűk fogalomhoz kötődnek: a kísérletekben írásjelekhez, mondattani mintákhoz, lexikai jelentésekhez és magas szintű témákhoz kapcsolódó aktivációkat is találtak.

A neuronoknál jobban jelezhetik az egyszerű szövegjellemzőket

A kutatók legfeljebb 410 millió paraméteres nyelvi modelleken alkalmazták a módszert. Kísérleteik alapján a kódok jobban jelezték előre az egyszerű szövegjellemzőket, mint az egyes neuronok.

A módszer közben a modell viselkedésének irányítására is használható. A FAR.AI példája szerint, ha közvetlenül aktiválják a sárkány fogalmához tartozó kódot, a hálózat legtöbbször sárkányokról szóló szöveget generál. Ez a lehetőség a kutatók szerint a modell belső működésének megértése mellett a viselkedés szabályozását is támogathatja.

Jelentős információcsökkentés mellett is korlátozott romlás

A FAR.AI szerint a kvantálási szűk keresztmetszet az aktivációs vektor információtartalmát több mint 100-szorosára csökkentette, miközben a következő token előrejelzésének pontossága a legtöbb esetben kevesebb mint 5 százalékkal esett vissza. A szervezet ezt a teljesítmény és az értelmezhetőség közötti kompromisszum szempontjából fontos eredményként mutatja be.

A kutatók szerint a Codebook Features ígéretes alapot adhat az olyan módszerekhez, amelyek több rétegen átívelő áramköröket tárnak fel, összetettebb módon szabályozzák a modellek viselkedését, és kezelhetőbbé teszik a nagyobb léptékű értelmezhetőségi vizsgálatokat.

A módszer jelentősége a felhasználók számára

A bemutatott technika a felhasználók szempontjából azért lehet fontos, mert a modell egyes fogalmakhoz kapcsolódó belső állapotai vizsgálhatóbbá és közvetlenül módosíthatóvá válhatnak. A forrásban szereplő eredmények ugyanakkor legfeljebb 410 millió paraméteres nyelvi modellekre vonatkoznak, ezért a leírás nem állítja, hogy a módszert nagyobb modelleken is ugyanilyen eredménnyel tesztelték.

A FAR.AI a teljes tanulmányt és egy Hugging Face-en elérhető bemutatót is megemlít. A blogbejegyzésben October 18, 2023 dátum szerepel, a szerzők Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman és Euan McLean.

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…