Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Goodfire feltérképezte a Llama 3.3 70B rejtett jellemzőit

2026. október 1.Forrás: Goodfire Research
A Goodfire feltérképezte a Llama 3.3 70B rejtett jellemzőit
Kép: Goodfire Research

A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B belső jellemzőit, majd értelmezett modellt és API-hozzáférést tett elérhetővé. A kutatás szerint a módszerrel egyes viselkedések célzottan módosíthatók, de az irányítás pontatlanságot is okozhat.

A lényeg röviden
  • A Goodfire SAE-ket tanított a Llama 3.3 70B modellen.
  • Interaktív térképen jelenítette meg a modell belső jellemzőit.
  • A jellemzők vezérlésével megváltoztatható volt a válaszok stílusa.
  • Az erősebb vezérlés a válaszok tényszerűségét is ronthatta.
  • A Goodfire 3,5 százaléknyi jellemzőt távolított el a Llama 3.3 70B SAE-jéből.

Térkép készült a modell belső jellemzőiről

A Goodfire közlése szerint ritka autoenkódereket, angolul sparse autoencoders, SAE-ket tanítottak a Llama 3.3 70B modellen. Az értelmezett modellt általános hozzáférésre, API-n keresztül adták ki. A vállalat szerint ez a legfejlettebb, nyilvánosan elérhető modell, amelyhez értelmezhetőségi eszközök tartoznak.

A kutatók a modell egy köztes rétegének jellemzőterét vizsgálták. Az SAE-k olyan látens jellemzőket tárnak fel, amelyekhez a Goodfire API-ján keresztül vezérlés és osztályozás kapcsolható. A jellemzőkről interaktív térkép is készült, amelyhez DataMapPlot segítségével UMAP-vizualizációt használtak. A módszer a magas dimenziójú adatokat alacsonyabb dimenziójú térben jeleníti meg.

A kutatók szerint a speciális formázási jelekhez és a beszélgetési adatok ismétlődő elemeihez kapcsolódó jellemzők gyakran elszigetelt pontokként vagy kisebb klaszterekként jelennek meg. Erre két lehetséges magyarázatot adnak: ezek a speciális jelek nagy értékűek lehetnek, illetve gyakori ismétlődésük miatt a ritka autoenkóder és az alapmodell megjegyezhette őket.

Biomedicina, fizika és programozás is megjelent

A Goodfire példái alapján az SAE a kizárólag internetes csevegési adatokon végzett tanítás ellenére sokféle fogalmat különített el. A kutatók többek között biomedicinához, fizikához és programozáshoz kapcsolódó klasztereket találtak. Névhez kötődő absztrakciók, például helyőrzők, hivatkozások és névelőtagok szintén egymás közelében jelentek meg.

A vizsgálat egy nagy és részletes, fonetikai, illetve karakterekhez kapcsolódó jellemzőkből álló klasztert is azonosított. A kutatók szerint további kérdés, hogy ezek a jellemzők mutatnak-e úgynevezett abszorpciót. A viselkedéstípusok között több pontos különbséget is láttak, ezek eltérő hatását azonban még nem ellenőrizték.

A modell irányítása során egy kiválasztott látens jellemző értékét növelték. Egy példában a Llama 3.3 70B az Androméda-galaxisról válaszolt, miközben a kutatók a kalózbeszéd stílusát erősítették. A stílus körülbelül 0,5-ös vezérlési erősségnél teljesen átalakult, 0,4-nél pedig már megjelentek a kalózbeszéd elemei.

A vezérlés a tényszerűség rovására mehet

A Goodfire tapasztalatai szerint a vezérlés erősödésével fokozatosan romlott a válaszok tényszerűsége. 0,6-os erősségnél a legtöbb állítás még helyes volt, de a galaxis méretére vonatkozó adat hibás lett. 1-es erősségnél már több tény is tévesen szerepelt, a modell pedig tengeri mértékegységekre, például csomóra váltott.

A kutatás egy értékelési problémára is felhívja a figyelmet. 1,4-es vezérlési erősségnél minden tényszerű állítás hibás volt, az értékelő modell mégis magas pontszámot adott. A Goodfire szerint ezt külön tényszerűségi mérőszámmal lehetne kezelni. A vállalat hangsúlyozza, hogy az értelmezhetőség és a modellvezérlés értékelésének jelenleg erős minőségi alapokra van szüksége.

A módszer biztonsági korlátokat is kapott. A Goodfire a káros jellemzőket eltávolította, a Llama 3.3 70B SAE-jéből körülbelül 3,5 százalékot, a Llama 3.1 8B esetében pedig 30 százalékot. Ezek az arányok az eltávolított, úgynevezett halott jellemzőket is tartalmazzák. Biztonsági kutatók az ellenőrzés nélküli SAE-khez e-mailben kérhetnek hozzáférést.

A Goodfire szerint a közlemény eredeti, 2024. december 23-i közzététele után, 2026 februárjában az SAE-demó felületét és API-ját megszüntették. A kutatásban bemutatott módszerek ugyanakkor azt mutatják, hogy az ilyen eszközök a modell belső működésének vizsgálatát és bizonyos válaszstílusok célzott módosítását is lehetővé tehetik, miközben a pontosság ellenőrzése elengedhetetlen marad.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A Llama 3.3 70B belső működését térképezte fel a Goodfire
Kutatás2026. október 1.

A Llama 3.3 70B belső működését térképezte fel a Goodfire

A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B köztes rétegének jellemzőit. A kutatás szerint ezek a jellemzők a modell viselkedésének elemzésére…

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát
Kutatás2026. október 1.

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát

A Goodfire kutatási oldala az „Open Problems in Mechanistic Interpretability” című anyag helyett egy arXiv-publikációhoz irányítja az olvasókat. Az oldal jelenlegi…