A Goodfire új módszerrel tárná fel a lát मॉडलlek belső fogalmait

A Goodfire bemutatta a Block-Sparse Featurizers, röviden BSF nevű módszercsaládot, amely a neurális hálózatok aktivációit többdimenziós alterekre bontja. A vállalat szerint a megközelítés értelmezhetőbb jellemzőket tár fel a látómodellekben, és pontosabb beavatkozást tesz lehetővé.
- A Goodfire bemutatta a Block-Sparse Featurizers módszercsaládot.
- A BSF-ek egyedi irányok helyett többdimenziós altereket keresnek.
- A módszer blokkszinten alkalmaz ritkaságot az aktivációk elemzésében.
- A Goodfire szerint a BSF-ek értelmezhetőbb jellemzőket találnak a látómodellekben.
- A kutatás szerint a modellek legtöbb fogalma többdimenziós.
A fogalmak nem feltétlenül egyenes vonalak
A Goodfire kutatása abból indul ki, hogy a neurális hálózatok belső reprezentációiban megjelenő fogalmak összetett, több dimenzió mentén változó struktúrák lehetnek. A vállalat a fa fogalmát hozza példaként: egy facsemete, egy tölgy, egy mamutfenyő és egy bonsai ugyanahhoz a fogalomhoz tartozik, mégis több szempont szerint különbözik egymástól. A levelek színe, a faj és a méret szintén eltérhet.
A kutatók szerint a fogalmak ilyen módon inkább strukturált terekben vagy sokdimenziós alakzatokként írhatók le, mint egyetlen irányként. A neurális hálózatok értelmezésében használt elterjedt módszerek, például a ritka autoenkóderek és a transzkóderek azonban gyakran úgy kezelik az egyes fogalmakat, mintha azok egyenes vonalak lennének.
Blokkokban keresik a modell működését
A BSF-ek a modell aktivációit többdimenziós alterekre bontják. Egy ilyen altér több irányból álló blokk, amely egy összetettebb jellemző, például egy fogalomhoz kapcsolódó alakzat alapját adhatja. A módszer kulcsa a blokkszintű ritkaság, vagyis az, hogy egy adott bemenetnél kevés blokk aktiválódjon, ahelyett hogy kevés egyedi, egydimenziós jellemző működését feltételezné.
A Goodfire szerint ez a strukturált ritkaság elvéhez kapcsolódik, amely korábbi kutatásokban is megjelent. A vállalat három BSF-változatot mutat be: a vanilla BSF-et, a Grassmannian BSF-et és a group-lasso BSF-et. Ezek közös felépítést használnak, de eltérő kódolókat, dekódolókat és aktivációs függvényeket alkalmaznak. Mindegyik változatot a rekonstrukciós hiba minimalizálására tanítják.
A vanilla BSF lineáris kódolót és blokkonkénti TopK aktivációt használ. Ennél a kiválasztás az egyes blokkok L2-normája alapján történik. A kutatók szerint a blokkszintű ritkaság elve fontosabbnak bizonyult, mint az, hogy pontosan melyik megvalósítást választják.
A kutatás szerint értelmezhetőbb jellemzők nyerhetők ki
A Goodfire egy mesterséges, előre meghatározott struktúrákat tartalmazó tesztmodellen is összehasonlította a módszereket. A vállalat leírása szerint a hagyományos ritka autoenkóder nehezebben rekonstruálta az alapul szolgáló sokdimenziós alakzatokat, és több redundáns jellemző között darabolta fel azokat. A BSF ezzel szemben koherensebben állította elő ezeket az altereket a tanítás során.
A kutatók látómodelleken is vizsgálták a megközelítést. Állításuk szerint a BSF-ek értelmezhető, többdimenziós jellemzőket találtak, amelyek jobban magyarázzák a modellek aktivációit, és finomabb vezérlést tesznek lehetővé. A Goodfire következtetése szerint a vizsgált modellek fogalmainak többsége többdimenziós.
A tanulmányt 2026. július 7-én publikálták. A teljes tanulmány az arXivon, a kapcsolódó kód pedig a GitHubon érhető el a Goodfire hivatkozásai szerint. A módszer jelentősége a felhasználók számára elsősorban közvetett: ha a modellek belső jellemzői pontosabban feltérképezhetők, a kutatók részletesebben vizsgálhatják, hogyan épül fel a látómodellek működése, és hogyan lehet azt célzottan befolyásolni.
Goodfire Research: Uncovering Neural Geometry in Vision Models With Block-Sparse Featurizers - Goodfire


