Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Anthropic feltárta, hogyan torzíthatják a nyelvi modellek súlyai az értelmezést

2026. augusztus 21.Forrás: Anthropic Interpretability (Transformer Circuits)

Az Anthropic kutatói egy egyrétegű transzformerben vizsgálták, hogyan különíthetők el a modell ténylegesen hasznos kapcsolatai az értelmezést zavaró, úgynevezett interferencia súlyoktól. Eredményeik szerint a nyers súlyok nagysága önmagában félrevezető lehet.

A lényeg röviden
  • Az Anthropic egy egyrétegű transzformerben vizsgálta az interferencia súlyokat.
  • A nyers súlyok nagysága önmagában nem jelzi, hogy egy kapcsolat hasznos-e.
  • A legkevésbé hatékony súlyok 70 százalékának törlése 0,01 nattal rontotta a veszteséget.
  • A leghatékonyabb súlyok túlnyomó többsége hasznosnak bizonyult.
  • A kutatók szerint egy jobb komponensbázis további ritkítást tehet lehetővé.

A súlyok önmagukban nem árulják el a modell működését

Az Anthropic mechanisztikus értelmezhetőséggel foglalkozó kutatói azt vizsgálták, hogyan lehet egy neurális hálózat számításait úgy olvasni, mintha egy számítógépes programról lenne szó. A munka központi problémája, hogy a modellek a rendelkezésükre álló reprezentációs kapacitást több különböző áramkör között osztják meg. Ezt a jelenséget szuperpozíciónak nevezik.

Az egyes neuronok emiatt több jelentéshez vagy jellemzőhöz is hozzájárulhatnak, ráadásul a szerepük a kontextustól függhet. A kutatók különböző módszerekkel, például szótártanulással próbálják ezeket a neuronokat értelmezhetőbb, önállóbb komponensekre bontani. Az így kapott komponensek közötti globális hatásokat virtuális súlyokként írják le.

A probléma azonban ekkor sem tűnik el. Az értelmezhető jellemzőket továbbra is alacsony dimenziós vetítéseken keresztül írják és olvassák, ezért a virtuális súlyok is szuperpozícióba kényszerülnek. Az interferencia súlyok olyan lineáris kapcsolatok, amelyek irrelevánsak vagy károsak a modell működésére. Olyan komponenseket is összeköthetnek, amelyek a tényleges adatokon soha nem aktiválódnak együtt.

Egy apró modellben mérték a kapcsolatok hatását

A 2026. augusztus 21-én közzétett tanulmányban Nicholas L. Turner, Jeffrey Wu és Joshua Batson egy egyrétegű transzformert tanítottak be. A modellt tokenekre, pozíciókra, jellemzőkre és kimeneti logitokra bontották, majd megvizsgálták, hogyan állnak össze ezek a súlyok a modell viselkedésévé.

Két szempontot használtak. Egy súly hatékonysága azt méri, mekkora hatással van a modell kimeneteire. A hasznosság azt mutatja meg, mekkora és milyen irányú hatással van a veszteségre. A kutatók szerint a hasznosság pontosan jelzi az interferencia súlyokat, kiszámítása viszont költséges. Egy súlynak hatékonynak kell lennie ahhoz, hogy egyáltalán hasznos vagy káros legyen, de a hatékonység nagysága önmagában nem árulja el, hogy a súly javítja vagy rontja a modellt.

A kutatók az ACETYLCHOLINE szó befejezését is elemezték. A modellnek az utolsó „E” tokent kell előre jeleznie, miután az „IN” token megjelent. Az „IN” és a kimeneti logitok közötti egyik legerősebb virtuális súly azonban az „utions” folytatást támogatja. Ez a token a betanítási adatokban soha nem követte az „IN” tokent, ezért ez a hatás minden alkalommal növeli a modell veszteségét.

A leghatékonyabb kapcsolatok többnyire hasznosak

Az Anthropic három fő eredményt emel ki. Először, a hasznos és káros súlyok a virtuális súlyok teljes nagyságtartományában megtalálhatók. Emiatt a nyers súlyok alapján végzett, egyszerű értelmezés kihagyhat fontos áramköröket, miközben olyan kapcsolatokat emelhet ki, amelyek a valós adatokon alig számítanak.

Másodszor, a hatástalan virtuális súlyok nagy számban fordulnak elő, és viszonylag könnyen eltávolíthatók. A legkevésbé hatékony súlyok 70 százalékának törlése mindössze 0,01 nattal rontotta a modell veszteségét, 85 százalékuk eltávolítása pedig 0,1 natos romlással járt. A leghatékonyabb súlyok túlnyomó többsége hasznosnak bizonyult, és hatásuk egy nagyságrenddel meghaladta a káros súlyokét.

Harmadszor, az értelmezhetőbbnek szánt virtuális súlymodellben továbbra is sok hasznos kapcsolat maradt. A kutatók által használt egyszerű összehasonlítás szerint még a leghatékonyabb és leghasznosabb súlyokra korlátozva is több ilyen súly szerepel benne, mint ahány paraméter az eredeti transzformerben. Az Anthropic szerint egy jobb komponensbázis további ritkítást és jobb értelmezhetőséget tehet lehetővé.

Miért fontos ez a modellek értelmezésében?

A kutatás egy konkrét, betanított transzformerben mutat be olyan interferencia súlyt, amelynek káros hatását a tanítási veszteségen keresztül is meg lehet mérni. A szerzők szerint ez eltér a korábbi, egyszerű játékmodelleken végzett munkától, ahol a hálózat egy nagyobb, ritka referenciamodell utánzását tanulta.

Az eredmények alapján a modell belső működésének feltárásakor nem elég a nagy súlyokat vagy a legerősebbnek látszó kapcsolatokat megkeresni. A felhasználható áramkörök elkülönítéséhez azt is vizsgálni kell, hogy egy kapcsolat ténylegesen hat-e a kimenetre, és javítja vagy rontja-e a modell veszteségét. Ez olyan ritkítási eljárások felé mutat, amelyek a működés szempontjából hatástalan vagy káros kapcsolatokat távolítják el.

Forrás
Anthropic Interpretability (Transformer Circuits): Characterizing interference weights in a tiny language model

Kapcsolódó hírek

Kimi K3: Claude-klón vagy önálló fejlesztés?
Modellek2026. október 2. 16:12

Kimi K3: Claude-klón vagy önálló fejlesztés?

A Moonshot AI Kimi K3 modellje 2,8 billió paraméterével az első nyílt súlyú modell ezen a méreten. A megjelenés után felmerült, hogy a fejlesztés Anthropic-modellből…

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el
Kutatás2026. szeptember 29. 17:00

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el

Az Opus 5.5 valóban szinte teljesen elhagyta a hosszú gondolatjeleket, és a Claude-ra jellemző stiláris fordulatok száma is csökkent. Az Arize AI vizsgálata szerint…

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen
Kutatás2026. szeptember 29. 17:00

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen

Az Opus 5.5 valóban sokkal kevesebb em dash jelet és Claude-ra jellemző fordulatot használ, mint az Opus 5, de az Arize AI vizsgálata szerint a probléma nem tűnt el…