Az Apple kutatói szerint jól értelmezhetők az aktivációs jellemzők

Az Apple kutatói az ExpertLens nevű módszerrel vizsgálták, hogy értelmezhetők-e a nagy nyelvi modellek aktiváció-vezérléssel azonosított jellemzői. Eredményeik szerint a reprezentációk stabilak különböző modellek és adatkészletek között, és szorosan igazodnak az emberek fogalmi reprezentációihoz.
- Az ExpertLens az aktiváció-vezérléssel azonosított neuronok vizsgálatára épül.
- A módszerrel több modellben és adatkészleten is stabil reprezentációkat találtak.
- Az eredmények az emberi fogalmi reprezentációkhoz is szorosan igazodtak.
- Az ExpertLens jelentősen felülmúlta a szó- és mondatbeágyazásokat az igazodás mérésében.
- A kutatók rugalmas és könnyű elemzési módszerként írják le az eljárást.
Neuronok alapján vizsgálták a modell fogalmait
Az ExpertLens című tanulmány az aktiváció-vezérlés (activation steering) módszereit vizsgálja. Ezek az eljárások a nagy nyelvi modellek működésének célzott módosítására szolgálnak, például azért, hogy a modellek által generált nyelvet egy kívánt irányba tereljék. A módszerhez az Apple kutatói szerint nincs szükség nagy mennyiségű alkalmazkodási adatra.
A kutatócsoport azt vizsgálta, hogy az aktiváció-vezérlési módszerekkel felfedezett jellemzők értelmezhetők-e. A „finding experts” nevű, korábbi aktiváció-vezérlési kutatásokból származó eljárással olyan neuronokat azonosítottak, amelyek meghatározott fogalmakért felelősek. Példaként a „macska” fogalmát említik.
Az ExpertLens ezeknek a neuronoknak a vizsgálatára épül. A kutatók szerint ez betekintést adhat abba, hogyan reprezentálják a modellek a fogalmakat.
Az eredmények több modellen és adatkészleten is stabilak voltak
A tanulmány szerint az ExpertLens által feltárt reprezentációk stabilnak bizonyultak különböző modellek és adatkészletek használata mellett is. A kutatók ezeket a reprezentációkat emberi viselkedési adatokból következtetett fogalmi reprezentációkkal vetették össze.
Az Apple kutatói úgy találták, hogy az ExpertLens eredményei szorosan igazodnak az emberi reprezentációkhoz. Az egyezés szintje elérte az emberek közötti igazodás mértékét. A vizsgálatban az ExpertLens az egyezés szempontjából jelentősen felülmúlta a szó- és mondatbeágyazások (word/sentence embeddings) által elért szintet.
A kutatók az emberi fogalmi szerveződés ExpertLens segítségével történő rekonstrukciójával azt mutatták be, hogy az eljárás részletes képet adhat arról, miként jelennek meg a fogalmak a nagy nyelvi modellekben.
Könnyű és rugalmas elemzési módszer lehet
A tanulmány következtetése szerint az ExpertLens rugalmas és könnyű megközelítést kínál a modellreprezentációk rögzítésére és elemzésére. Ez az aktiváció-vezérlés kutatásában azért fontos, mert a módszerrel azonosított neuronok vizsgálata közvetlenebb képet adhat a modellekben tárolt vagy feldolgozott fogalmakról.
A tanulmányt Masha Fedzechkina, Eleonora Gualdoni, Sinead Williamson, Katherine Metcalf, Skyler Seto és Barry-John Theobald jegyzi. A dolgozatot 2025 novemberében publikálták, és elfogadták a NeurIPS 2025 keretében megrendezett Workshop on Unifying Representations in Neural Models, vagyis UniReps műhelybe.
Az Apple kutatási oldala 2026. szeptember 18-án közölte az anyagot. A forrás alapján az ExpertLens elsősorban kutatási eszköz a nagy nyelvi modellek belső reprezentációinak elemzésére. A bemutatott eredmények azt támasztják alá, hogy az aktiváció-vezérléssel azonosított jellemzők emberi viselkedési adatokhoz is kapcsolható, részletes vizsgálati alapot adhatnak.


