Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait

2026. október 1.Forrás: Goodfire Research
A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
Kép: Goodfire Research

A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók szerint a kísérletek azt mutatják, hogy az R1 belső működése több szempontból eltér a hagyományos nyelvi modellekétől.

A lényeg röviden
  • A Goodfire két SAE-t készített a 671 milliárd paraméteres DeepSeek R1-hez.
  • Az eszközök általános és matematikai gondolkodási folyamatokat vizsgálnak.
  • Az R1 irányítása a kutatók szerint csak a gondolkodási nyom egy későbbi pontján működött megbízhatóbban.
  • Túlzott beavatkozás esetén az R1 egyes helyzetekben visszatérhetett eredeti viselkedéséhez.
  • A Goodfire nyílt forrásúvá tette az SAE-ket és a kapcsolódó adathalmaz egy részét.

Két eszközzel vizsgálták az R1 működését

A Goodfire április 15-én tette közzé kutatását a DeepSeek R1 mechanisztikus értelmezhetőségéről. A terület célja, hogy a neurális hálózatok információfeldolgozását belső komponenseik visszafejtésével tegye érthetőbbé.

A vállalat két ritka autoenkódert, angolul sparse autoencoder, vagyis SAE-t készített. Az egyik az R1 általános gondolkodási képességeit vizsgáló, egyedi adathalmazon tanult, a másik pedig az OpenR1-Math matematikai gondolkodási adathalmazt használta. A Goodfire ezeket az első nyilvános értelmező modellekként mutatja be, amelyeket valódi reasoning modellen és ekkora méretű modellen tanítottak.

Az R1 671 milliárd paraméteres, nem desztillált változatának futtatása mérnöki szempontból is komoly feladat. A kutatók saját következtetési motorjukat és értelmezőmodell-tanítási infrastruktúrájukat használták. A projekt részeként a tanításhoz használt egyedi gondolkodási adathalmazt is nyílt forrásúvá tették.

A visszalépés és a gondolkodás is vizsgálható

Az SAE-k több olyan jellemzőt tanultak meg, amelyek a reasoning modellek működéséhez kapcsolódnak, például a korábbi gondolatmenet elhagyását és egy másik megközelítés kipróbálását, vagyis a visszalépést. A kutatók az egyes jellemzőkhöz tartozó legerősebben aktiválódó példákat SQL-adatbázisokban is közzétették, hogy az R1 nagy mérete miatt az önálló kutatók számára könnyebben használható legyen az anyag.

A Goodfire két kezdeti megfigyelést tett a modell irányításával kapcsolatban. Az R1 válaszának elején végzett beavatkozás gyakran nem működött megfelelően. A kutatók szerint hatékonyabban tudták módosítani a viselkedését, miután a modell elkezdte a válaszát egy olyan fordulattal, mint az „Okay, so the user has asked a question about…”.

A vállalat szerint az angol nyelvű gondolkodási nyomok több mint 95 százaléka „Okay,” kezdetű. Ez arra utalhat, hogy az R1 ezeket a gyakori fordulatokat inkább a feladat részének, mint a tényleges válasz kezdetének kezeli. A kutatók eltérő jellemzőeloszlást figyeltek meg a promptban, a gondolkodási nyomban és az asszisztens válaszában is.

A túlzott beavatkozás visszaállíthatja az eredeti viselkedést

A másik megfigyelés szerint egyes jellemzők túlzott erősítése nem fokozza korlátlanul a kívánt változást. A kutatók például azt látták, hogy a beavatkozás egy pontján az R1 visszatérhet az eredeti működéséhez. Csak még erősebb módosítás után válik a kimenet összefüggéstelenné.

A Goodfire munkahipotézise szerint a modell érzékeli, amikor a belső aktivációi túlságosan eltérnek a megszokottól, majd leáll és korrigálja a folyamatot. A kutatók ezt azzal hozzák kapcsolatba, hogy az R1 nehéz feladatoknál gyakran visszalép, ha egy gondolatmenet nem vezet eredményre.

A jelenség az értelmezhetőség és a biztonság szempontjából is fontos lehet. A Goodfire szerint a viselkedés célzott módosítása, például a tisztességtelen válaszok visszaszorítása, összetettebb módszereket igényelhet, ha a modellek képesek kikerülni a beavatkozásokat. A kutatók hangsúlyozzák, hogy további vizsgálatok szükségesek, és nyílt forrású eszközeikkel mások eredményeire is kíváncsiak.

A mechanisztikus értelmezhetőség a vállalat szerint segíthet a modellek képességeinek és korlátainak feltárásában, a váratlan hibák felismerésében és javításában, valamint célzottabb biztonsági beavatkozások kidolgozásában. Az SAE-k önmagukban nem oldják meg az értelmezhetőség teljes problémáját, de a Goodfire szerint fontos eszközt jelentenek a reasoning modellek belső működésének kutatásában.

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2. 22:37

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
Kutatás2026. október 1.

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire

A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több…