Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Goodfire új módszerrel tárná fel a lát मॉडलlek belső fogalmait

2026. július 7.Forrás: Goodfire Research
A Goodfire új módszerrel tárná fel a lát मॉडलlek belső fogalmait
Kép: Goodfire Research

A Goodfire bemutatta a Block-Sparse Featurizers, röviden BSF nevű módszercsaládot, amely a neurális hálózatok aktivációit többdimenziós alterekre bontja. A vállalat szerint a megközelítés értelmezhetőbb jellemzőket tár fel a látómodellekben, és pontosabb beavatkozást tesz lehetővé.

A lényeg röviden
  • A Goodfire bemutatta a Block-Sparse Featurizers módszercsaládot.
  • A BSF-ek egyedi irányok helyett többdimenziós altereket keresnek.
  • A módszer blokkszinten alkalmaz ritkaságot az aktivációk elemzésében.
  • A Goodfire szerint a BSF-ek értelmezhetőbb jellemzőket találnak a látómodellekben.
  • A kutatás szerint a modellek legtöbb fogalma többdimenziós.

A fogalmak nem feltétlenül egyenes vonalak

A Goodfire kutatása abból indul ki, hogy a neurális hálózatok belső reprezentációiban megjelenő fogalmak összetett, több dimenzió mentén változó struktúrák lehetnek. A vállalat a fa fogalmát hozza példaként: egy facsemete, egy tölgy, egy mamutfenyő és egy bonsai ugyanahhoz a fogalomhoz tartozik, mégis több szempont szerint különbözik egymástól. A levelek színe, a faj és a méret szintén eltérhet.

A kutatók szerint a fogalmak ilyen módon inkább strukturált terekben vagy sokdimenziós alakzatokként írhatók le, mint egyetlen irányként. A neurális hálózatok értelmezésében használt elterjedt módszerek, például a ritka autoenkóderek és a transzkóderek azonban gyakran úgy kezelik az egyes fogalmakat, mintha azok egyenes vonalak lennének.

Blokkokban keresik a modell működését

A BSF-ek a modell aktivációit többdimenziós alterekre bontják. Egy ilyen altér több irányból álló blokk, amely egy összetettebb jellemző, például egy fogalomhoz kapcsolódó alakzat alapját adhatja. A módszer kulcsa a blokkszintű ritkaság, vagyis az, hogy egy adott bemenetnél kevés blokk aktiválódjon, ahelyett hogy kevés egyedi, egydimenziós jellemző működését feltételezné.

A Goodfire szerint ez a strukturált ritkaság elvéhez kapcsolódik, amely korábbi kutatásokban is megjelent. A vállalat három BSF-változatot mutat be: a vanilla BSF-et, a Grassmannian BSF-et és a group-lasso BSF-et. Ezek közös felépítést használnak, de eltérő kódolókat, dekódolókat és aktivációs függvényeket alkalmaznak. Mindegyik változatot a rekonstrukciós hiba minimalizálására tanítják.

A vanilla BSF lineáris kódolót és blokkonkénti TopK aktivációt használ. Ennél a kiválasztás az egyes blokkok L2-normája alapján történik. A kutatók szerint a blokkszintű ritkaság elve fontosabbnak bizonyult, mint az, hogy pontosan melyik megvalósítást választják.

A kutatás szerint értelmezhetőbb jellemzők nyerhetők ki

A Goodfire egy mesterséges, előre meghatározott struktúrákat tartalmazó tesztmodellen is összehasonlította a módszereket. A vállalat leírása szerint a hagyományos ritka autoenkóder nehezebben rekonstruálta az alapul szolgáló sokdimenziós alakzatokat, és több redundáns jellemző között darabolta fel azokat. A BSF ezzel szemben koherensebben állította elő ezeket az altereket a tanítás során.

A kutatók látómodelleken is vizsgálták a megközelítést. Állításuk szerint a BSF-ek értelmezhető, többdimenziós jellemzőket találtak, amelyek jobban magyarázzák a modellek aktivációit, és finomabb vezérlést tesznek lehetővé. A Goodfire következtetése szerint a vizsgált modellek fogalmainak többsége többdimenziós.

A tanulmányt 2026. július 7-én publikálták. A teljes tanulmány az arXivon, a kapcsolódó kód pedig a GitHubon érhető el a Goodfire hivatkozásai szerint. A módszer jelentősége a felhasználók számára elsősorban közvetett: ha a modellek belső jellemzői pontosabban feltérképezhetők, a kutatók részletesebben vizsgálhatják, hogyan épül fel a látómodellek működése, és hogyan lehet azt célzottan befolyásolni.

Kapcsolódó hírek

Nem érhető el a Goodfire kutatásának érdemi szövege
Kutatás2026. október 1.

Nem érhető el a Goodfire kutatásának érdemi szövege

A megadott Goodfire-forrásrészlet nem tartalmazza a „Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation” című kutatás érdemi szövegét vagy…

A Goodfire kutatási oldala az arXivra irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala az arXivra irányítja az olvasókat

A Goodfire Research „Why Larger Models Learn More” című oldala jelenlegi szövege szerint az arXivra irányítja az olvasókat. A megadott oldalon a kutatás részletes…

A Goodfire kutatási oldala már az arXiv-tanulmányra irányít
Kutatás2026. október 1.

A Goodfire kutatási oldala már az arXiv-tanulmányra irányít

A Goodfire Research Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering című oldala már az arXiv-tanulmányra irányítja az olvasókat. A…