A Llama 3.3 70B belső működését térképezte fel a Goodfire

A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B köztes rétegének jellemzőit. A kutatás szerint ezek a jellemzők a modell viselkedésének elemzésére és bizonyos irányítására is használhatók, bár az eljárásnak komoly korlátai vannak.
- A Goodfire SAE-k segítségével vizsgálta a Llama 3.3 70B belső jellemzőit.
- A térképen biomedicinai, fizikai, programozási és nyelvi mintázatok is megjelentek.
- A jellemzők módosítása megváltoztathatta a modell stílusát, de ronthatta a tényszerűséget.
- A Llama 3.3 70B SAE-jellemzőinek körülbelül 3,5 százalékát moderálták.
- A demófelületet és az API-t a Goodfire 2026 februárjában megszüntette.
A modell rejtett jellemzőit térképezték fel
A Goodfire kutatói ritka autoenkódereket, angolul sparse autoencoders, röviden SAE-ket tanítottak a Llama 3.3 70B modellen. Ezek segítségével a modell egy köztes rétegének jellemzőit vizsgálták, majd egy interaktív térképen tették böngészhetővé az azonosított mintázatokat.
A vállalat 2024. december 23-án közzétett kutatási bejegyzése szerint a módszerrel olyan jellemzőket találtak, amelyek többek között biomedicinai ismeretekhez, fizikához, programozáshoz, nevekhez, idézetekhez, helyettesítő szövegekhez, fonetikához és karakterekhez kapcsolódnak. A Goodfire szerint a modellt kizárólag internetes csevegési adatokon vizsgálták, ennek ellenére meglepően széles fogalmi tartomány jelent meg az elemzésben.
A jellemzőket UMAP-vizualizációval ábrázolták. A kutatók szerint a speciális formázási tokenekhez és a csevegési adatok ismétlődő elemeihez, például a tudásvágás dátumához kapcsolódó jellemzők gyakran elkülönült pontokként vagy kisebb klaszterekként jelentek meg. Ennek lehetséges oka, hogy a speciális tokenek nagy aktivitást válthatnak ki, illetve az ismétlődő elemeket a SAE és az alapmodell is megjegyezhette.
A jellemzők módosíthatják a modell stílusát
A Goodfire bemutatta azt is, hogyan lehet egyes SAE-jellemzők értékének növelésével módosítani a modell válaszait. Az egyik példában a Llama 3.3 70B-t az Androméda-galaxisról kérdezték, miközben különböző erősséggel egy kalózos beszédstílus felé terelték.
A kutatásban szereplő értékelés szerint a stílus körülbelül 0,5-ös erősségnél váltott látványosan, de már 0,4-nél megjelentek a kalózos beszéd egyes elemei. A kutatók ugyanakkor azt tapasztalták, hogy a terelés erősödésével fokozatosan romlott a tényszerűség. 0,6-os erősségnél a legtöbb állítás még helyes volt, de a galaxis mérete már hibásan szerepelt. 1-es értéknél több tény is téves lett, és a válaszokban tengeri mértékegységek jelentek meg.
A példa az értékelési módszer problémáira is rávilágított. 1,4-es erősségnél minden tényszerű állítás hibás volt, a modell mégis magas pontszámot kapott, mert az értékelés elsősorban a kívánt viselkedést mérte. A Goodfire szerint a tényszerűséget külön mérő értékelésre lenne szükség.
Biztonsági szűrés és módszertani korlátok
A Goodfire közlése szerint a káros jellemzőket kiszűrték. A Llama 3.3 70B-hez készült SAE-ben a jellemzők körülbelül 3,5 százalékát távolították el, ebbe a használaton kívüli, úgynevezett halott jellemzők is beletartoztak. A vállalat szerint ezek többsége grafikus bűnügyi tartalmak leírásához kapcsolódott, és az LMSys chat adathalmaz felhasznált részhalmazait tükrözte.
A kutatók úgy vélik, hogy a jelenlegi nyílt modelleken készült SAE-k közzététele önmagában érdemben nem növeli többek között a biológiai kockázatokat vagy a meggyőzéshez kapcsolódó kockázatokat, mert az alapmodell ehhez nem tűnik kellően képessé. A Goodfire ugyanakkor ezek nyomon követését és biztonsági értékelések fejlesztését ígéri. Biztonsági kutatók e-mailben kérhetnek hozzáférést a nem moderált SAE-khez.
A módszer egyik fő korlátja, hogy a jellemzők irányítása és osztályozóként való használata eltérő SAE-kialakítást igényelhet. A tereléshez a modell közepén elhelyezkedő, keskenyebb és ritkább SAE-k lehetnek előnyösebbek, míg az osztályozási feladatokhoz a modell korábbi vagy későbbi rétegeiben működő, szélesebb SAE-k bizonyulhatnak alkalmasabbnak.
A hozzáférés időközben megváltozott
A kutatás eredeti bejelentése szerint az értelmezett modellhez API-n keresztül lehetett hozzáférni, a jellemzőket pedig egy interaktív felületen lehetett vizsgálni és irányításra használni. A Goodfire későbbi frissítése szerint azonban az SAE-demófelületet és az API-t 2026 februárjában megszüntették.
Ez azt jelenti, hogy a kutatás módszertani eredményei továbbra is használhatók a modellértelmezhetőség vizsgálatának bemutatására, de a bejegyzésben szereplő közvetlen kísérleti hozzáférés már nem érhető el ugyanúgy. A Goodfire szerint az ilyen eszközök célja új kutatások és termékek támogatása, miközben a terelés megbízhatósága és az értékelés minősége még fejlesztésre szorul.
Goodfire Research: Mapping the Latent Space of Llama 3.3 70B - Goodfire


