Goodfire Research

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók…

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több…

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát
A Goodfire kutatási oldala az „Open Problems in Mechanistic Interpretability” című anyag helyett egy arXiv-publikációhoz irányítja az olvasókat. Az oldal jelenlegi…

Belső jelek árulhatják el, ha egy AI kijátssza a jutalmazást
A Goodfire Research olyan belső jelet azonosított AI-modellekben, amely a jutalom kijátszásához, vagyis a reward hackinghez kapcsolódik. A kutatók aktivációs próbákkal…