Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Llama 3.3 70B belső működését térképezte fel a Goodfire

2026. október 1.Forrás: Goodfire Research
A Llama 3.3 70B belső működését térképezte fel a Goodfire
Kép: Goodfire Research

A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B köztes rétegének jellemzőit. A kutatás szerint ezek a jellemzők a modell viselkedésének elemzésére és bizonyos irányítására is használhatók, bár az eljárásnak komoly korlátai vannak.

A lényeg röviden
  • A Goodfire SAE-k segítségével vizsgálta a Llama 3.3 70B belső jellemzőit.
  • A térképen biomedicinai, fizikai, programozási és nyelvi mintázatok is megjelentek.
  • A jellemzők módosítása megváltoztathatta a modell stílusát, de ronthatta a tényszerűséget.
  • A Llama 3.3 70B SAE-jellemzőinek körülbelül 3,5 százalékát moderálták.
  • A demófelületet és az API-t a Goodfire 2026 februárjában megszüntette.

A modell rejtett jellemzőit térképezték fel

A Goodfire kutatói ritka autoenkódereket, angolul sparse autoencoders, röviden SAE-ket tanítottak a Llama 3.3 70B modellen. Ezek segítségével a modell egy köztes rétegének jellemzőit vizsgálták, majd egy interaktív térképen tették böngészhetővé az azonosított mintázatokat.

A vállalat 2024. december 23-án közzétett kutatási bejegyzése szerint a módszerrel olyan jellemzőket találtak, amelyek többek között biomedicinai ismeretekhez, fizikához, programozáshoz, nevekhez, idézetekhez, helyettesítő szövegekhez, fonetikához és karakterekhez kapcsolódnak. A Goodfire szerint a modellt kizárólag internetes csevegési adatokon vizsgálták, ennek ellenére meglepően széles fogalmi tartomány jelent meg az elemzésben.

A jellemzőket UMAP-vizualizációval ábrázolták. A kutatók szerint a speciális formázási tokenekhez és a csevegési adatok ismétlődő elemeihez, például a tudásvágás dátumához kapcsolódó jellemzők gyakran elkülönült pontokként vagy kisebb klaszterekként jelentek meg. Ennek lehetséges oka, hogy a speciális tokenek nagy aktivitást válthatnak ki, illetve az ismétlődő elemeket a SAE és az alapmodell is megjegyezhette.

A jellemzők módosíthatják a modell stílusát

A Goodfire bemutatta azt is, hogyan lehet egyes SAE-jellemzők értékének növelésével módosítani a modell válaszait. Az egyik példában a Llama 3.3 70B-t az Androméda-galaxisról kérdezték, miközben különböző erősséggel egy kalózos beszédstílus felé terelték.

A kutatásban szereplő értékelés szerint a stílus körülbelül 0,5-ös erősségnél váltott látványosan, de már 0,4-nél megjelentek a kalózos beszéd egyes elemei. A kutatók ugyanakkor azt tapasztalták, hogy a terelés erősödésével fokozatosan romlott a tényszerűség. 0,6-os erősségnél a legtöbb állítás még helyes volt, de a galaxis mérete már hibásan szerepelt. 1-es értéknél több tény is téves lett, és a válaszokban tengeri mértékegységek jelentek meg.

A példa az értékelési módszer problémáira is rávilágított. 1,4-es erősségnél minden tényszerű állítás hibás volt, a modell mégis magas pontszámot kapott, mert az értékelés elsősorban a kívánt viselkedést mérte. A Goodfire szerint a tényszerűséget külön mérő értékelésre lenne szükség.

Biztonsági szűrés és módszertani korlátok

A Goodfire közlése szerint a káros jellemzőket kiszűrték. A Llama 3.3 70B-hez készült SAE-ben a jellemzők körülbelül 3,5 százalékát távolították el, ebbe a használaton kívüli, úgynevezett halott jellemzők is beletartoztak. A vállalat szerint ezek többsége grafikus bűnügyi tartalmak leírásához kapcsolódott, és az LMSys chat adathalmaz felhasznált részhalmazait tükrözte.

A kutatók úgy vélik, hogy a jelenlegi nyílt modelleken készült SAE-k közzététele önmagában érdemben nem növeli többek között a biológiai kockázatokat vagy a meggyőzéshez kapcsolódó kockázatokat, mert az alapmodell ehhez nem tűnik kellően képessé. A Goodfire ugyanakkor ezek nyomon követését és biztonsági értékelések fejlesztését ígéri. Biztonsági kutatók e-mailben kérhetnek hozzáférést a nem moderált SAE-khez.

A módszer egyik fő korlátja, hogy a jellemzők irányítása és osztályozóként való használata eltérő SAE-kialakítást igényelhet. A tereléshez a modell közepén elhelyezkedő, keskenyebb és ritkább SAE-k lehetnek előnyösebbek, míg az osztályozási feladatokhoz a modell korábbi vagy későbbi rétegeiben működő, szélesebb SAE-k bizonyulhatnak alkalmasabbnak.

A hozzáférés időközben megváltozott

A kutatás eredeti bejelentése szerint az értelmezett modellhez API-n keresztül lehetett hozzáférni, a jellemzőket pedig egy interaktív felületen lehetett vizsgálni és irányításra használni. A Goodfire későbbi frissítése szerint azonban az SAE-demófelületet és az API-t 2026 februárjában megszüntették.

Ez azt jelenti, hogy a kutatás módszertani eredményei továbbra is használhatók a modellértelmezhetőség vizsgálatának bemutatására, de a bejegyzésben szereplő közvetlen kísérleti hozzáférés már nem érhető el ugyanúgy. A Goodfire szerint az ilyen eszközök célja új kutatások és termékek támogatása, miközben a terelés megbízhatósága és az értékelés minősége még fejlesztésre szorul.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát
Kutatás2026. október 1.

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát

A Goodfire kutatási oldala az „Open Problems in Mechanistic Interpretability” című anyag helyett egy arXiv-publikációhoz irányítja az olvasókat. Az oldal jelenlegi…

A Goodfire feltérképezte a Llama 3.3 70B rejtett jellemzőit
Kutatás2026. október 1.

A Goodfire feltérképezte a Llama 3.3 70B rejtett jellemzőit

A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B belső jellemzőit, majd értelmezett modellt és API-hozzáférést tett elérhetővé. A kutatás szerint a…