A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire

A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több ponton eltér a hagyományos nyelvi modellekétől, és a viselkedésének módosítása is sajátos módszereket igényel.
- A Goodfire két SAE-t képzett a 671 milliárd paraméteres DeepSeek R1 modellen.
- Az egyik SAE általános, a másik matematikai következtetési adatokon tanult.
- Az R1 irányítása a gondolkodási folyamat elején nem működött megfelelően.
- Túl erős beavatkozás után a modell bizonyos esetekben visszatért eredeti viselkedéséhez.
- A kutatók az eszközöket és aktivációs példákat nyíltan hozzáférhetővé tették.
Két eszközzel vizsgálták a reasoning modellt
A Goodfire 2025. április 15-én számolt be arról, hogy elsőként képzett sparse autoencodereket, röviden SAE-ket, a DeepSeek R1 671 milliárd paraméteres, nem desztillált változatán. Ezek olyan értelmezhetőségi modellek, amelyek segítségével a kutatók a neurális hálózat belső komponenseit és az információfeldolgozásban betöltött szerepüket próbálják feltárni.
A vállalat két SAE-t készített. Az egyik egy általános következtetési adathalmazon, a másik az OpenR1-Math matematikai gondolkodást támogató adathalmazán tanult. A Goodfire saját következtetési motorját és modellképzési infrastruktúráját használta, mert az R1 mérete komoly mérnöki kihívást jelent a nagy léptékű futtatásnál.
A kutatók az adathalmazok mellett a saját, egyedi reasoning adathalmazukat is nyílt forrásúvá tették. Mivel az R1 futtatása a legtöbb független kutató számára nehéz lehet, SQL-adatbázisokat is feltöltöttek, amelyek az egyes jellemzőkhöz tartozó legerősebb aktivációs példákat tartalmazzák. A használati útmutató a projekthez kapcsolódó GitHub-oldalon érhető el.
A modell visszalépése és a viselkedés módosítása
A Goodfire SAE-i több, a következtetési modellekre jellemző működést is rekonstruáltak, köztük a visszalépést. A kutatók első kísérleteikben egyes jellemzők aktivációjának módosításával próbálták befolyásolni az R1 válaszait.
Az egyik megfigyelés szerint a beavatkozás nem működik megfelelően a gondolkodási folyamat elején. A kutatóknak meg kellett várniuk, amíg a modell a válaszát egy olyan bevezetővel kezdi, mint az „Okay, so the user has asked a question about…”. A Goodfire szerint az angol nyelvű reasoning nyomok több mint 95 százaléka „Okay,” kezdetű, ezért a modell ezt a fordulatot a tanulás során a prompt részének tekinthette.
A kutatók figyelemelszívó tokeneket is megfigyeltek ennek a bevezetőnek a vége felé. Ezek olyan tokenek, amelyeknél az átlagos aktiváció jóval magasabb a szokásosnál. A mintázat arra utalhat, hogy az R1 belső folyamataiban a tényleges válasz kezdete később következik be, mint azt egy külső megfigyelő várná.
Egy másik kísérletben a túl erős beavatkozás nem a módosított viselkedés fokozódásához vezetett. Bizonyos jellemzők esetében a modell egy idő után visszatért az eredeti működéséhez. A Goodfire munkahipotézise szerint a túlzottan megváltoztatott belső aktivációk zavarodottságot vagy következetlenséget jelezhetnek a modell számára, amely ezért leáll és korrigálja a gondolatmenetét.
Miért fontos ez a kutatás?
A Goodfire szerint a reasoning modellek eltérő belső működése miatt a viselkedésük megértéséhez és módosításához összetettebb módszerekre lehet szükség. Ha a modellek képesek felismerni, amikor egy gondolatmenet nem működik, majd visszalépni és másik megközelítést keresni, akkor a külső beavatkozások megkerülésére is találhatnak útvonalakat. A cég ezt különösen fontosnak tartja például a tisztességtelen válaszok visszaszorításánál.
A mechanisztikus értelmezhetőség célja a Goodfire meghatározása szerint a modellek képességeinek és korlátainak jobb megértése, a váratlan működés és hibák azonosítása, valamint célzottabb biztonsági beavatkozások kidolgozása. Az SAE-k önmagukban nem oldják meg ezt a teljes problémát, és a vállalat több ismert korlátra is felhívja a figyelmet.
A közzétett eszközök ugyanakkor hozzáférést adnak a kutatói közösségnek egy nagyméretű reasoning modell belső jellemzőinek vizsgálatához. A Goodfire további munkát tervez az R1 és más következtetési modellek működésének feltárására, és arra számít, hogy a most megosztott eszközök más kutatók új eredményeit is elősegítik.
Goodfire Research: Under the Hood of a Reasoning Model - Goodfire


