Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire

2026. október 1.Forrás: Goodfire Research
A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
Kép: Goodfire Research

A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több ponton eltér a hagyományos nyelvi modellekétől, és a viselkedésének módosítása is sajátos módszereket igényel.

A lényeg röviden
  • A Goodfire két SAE-t képzett a 671 milliárd paraméteres DeepSeek R1 modellen.
  • Az egyik SAE általános, a másik matematikai következtetési adatokon tanult.
  • Az R1 irányítása a gondolkodási folyamat elején nem működött megfelelően.
  • Túl erős beavatkozás után a modell bizonyos esetekben visszatért eredeti viselkedéséhez.
  • A kutatók az eszközöket és aktivációs példákat nyíltan hozzáférhetővé tették.

Két eszközzel vizsgálták a reasoning modellt

A Goodfire 2025. április 15-én számolt be arról, hogy elsőként képzett sparse autoencodereket, röviden SAE-ket, a DeepSeek R1 671 milliárd paraméteres, nem desztillált változatán. Ezek olyan értelmezhetőségi modellek, amelyek segítségével a kutatók a neurális hálózat belső komponenseit és az információfeldolgozásban betöltött szerepüket próbálják feltárni.

A vállalat két SAE-t készített. Az egyik egy általános következtetési adathalmazon, a másik az OpenR1-Math matematikai gondolkodást támogató adathalmazán tanult. A Goodfire saját következtetési motorját és modellképzési infrastruktúráját használta, mert az R1 mérete komoly mérnöki kihívást jelent a nagy léptékű futtatásnál.

A kutatók az adathalmazok mellett a saját, egyedi reasoning adathalmazukat is nyílt forrásúvá tették. Mivel az R1 futtatása a legtöbb független kutató számára nehéz lehet, SQL-adatbázisokat is feltöltöttek, amelyek az egyes jellemzőkhöz tartozó legerősebb aktivációs példákat tartalmazzák. A használati útmutató a projekthez kapcsolódó GitHub-oldalon érhető el.

A modell visszalépése és a viselkedés módosítása

A Goodfire SAE-i több, a következtetési modellekre jellemző működést is rekonstruáltak, köztük a visszalépést. A kutatók első kísérleteikben egyes jellemzők aktivációjának módosításával próbálták befolyásolni az R1 válaszait.

Az egyik megfigyelés szerint a beavatkozás nem működik megfelelően a gondolkodási folyamat elején. A kutatóknak meg kellett várniuk, amíg a modell a válaszát egy olyan bevezetővel kezdi, mint az „Okay, so the user has asked a question about…”. A Goodfire szerint az angol nyelvű reasoning nyomok több mint 95 százaléka „Okay,” kezdetű, ezért a modell ezt a fordulatot a tanulás során a prompt részének tekinthette.

A kutatók figyelemelszívó tokeneket is megfigyeltek ennek a bevezetőnek a vége felé. Ezek olyan tokenek, amelyeknél az átlagos aktiváció jóval magasabb a szokásosnál. A mintázat arra utalhat, hogy az R1 belső folyamataiban a tényleges válasz kezdete később következik be, mint azt egy külső megfigyelő várná.

Egy másik kísérletben a túl erős beavatkozás nem a módosított viselkedés fokozódásához vezetett. Bizonyos jellemzők esetében a modell egy idő után visszatért az eredeti működéséhez. A Goodfire munkahipotézise szerint a túlzottan megváltoztatott belső aktivációk zavarodottságot vagy következetlenséget jelezhetnek a modell számára, amely ezért leáll és korrigálja a gondolatmenetét.

Miért fontos ez a kutatás?

A Goodfire szerint a reasoning modellek eltérő belső működése miatt a viselkedésük megértéséhez és módosításához összetettebb módszerekre lehet szükség. Ha a modellek képesek felismerni, amikor egy gondolatmenet nem működik, majd visszalépni és másik megközelítést keresni, akkor a külső beavatkozások megkerülésére is találhatnak útvonalakat. A cég ezt különösen fontosnak tartja például a tisztességtelen válaszok visszaszorításánál.

A mechanisztikus értelmezhetőség célja a Goodfire meghatározása szerint a modellek képességeinek és korlátainak jobb megértése, a váratlan működés és hibák azonosítása, valamint célzottabb biztonsági beavatkozások kidolgozása. Az SAE-k önmagukban nem oldják meg ezt a teljes problémát, és a vállalat több ismert korlátra is felhívja a figyelmet.

A közzétett eszközök ugyanakkor hozzáférést adnak a kutatói közösségnek egy nagyméretű reasoning modell belső jellemzőinek vizsgálatához. A Goodfire további munkát tervez az R1 és más következtetési modellek működésének feltárására, és arra számít, hogy a most megosztott eszközök más kutatók új eredményeit is elősegítik.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2. 22:37

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
Kutatás2026. október 1.

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait

A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók…