Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple kutatói szerint jól értelmezhetők az aktivációs jellemzők

2026. szeptember 18.Forrás: Apple
Az Apple kutatói szerint jól értelmezhetők az aktivációs jellemzők
Kép: Apple

Az Apple kutatói az ExpertLens nevű módszerrel vizsgálták, hogy értelmezhetők-e a nagy nyelvi modellek aktiváció-vezérléssel azonosított jellemzői. Eredményeik szerint a reprezentációk stabilak különböző modellek és adatkészletek között, és szorosan igazodnak az emberek fogalmi reprezentációihoz.

A lényeg röviden
  • Az ExpertLens az aktiváció-vezérléssel azonosított neuronok vizsgálatára épül.
  • A módszerrel több modellben és adatkészleten is stabil reprezentációkat találtak.
  • Az eredmények az emberi fogalmi reprezentációkhoz is szorosan igazodtak.
  • Az ExpertLens jelentősen felülmúlta a szó- és mondatbeágyazásokat az igazodás mérésében.
  • A kutatók rugalmas és könnyű elemzési módszerként írják le az eljárást.

Neuronok alapján vizsgálták a modell fogalmait

Az ExpertLens című tanulmány az aktiváció-vezérlés (activation steering) módszereit vizsgálja. Ezek az eljárások a nagy nyelvi modellek működésének célzott módosítására szolgálnak, például azért, hogy a modellek által generált nyelvet egy kívánt irányba tereljék. A módszerhez az Apple kutatói szerint nincs szükség nagy mennyiségű alkalmazkodási adatra.

A kutatócsoport azt vizsgálta, hogy az aktiváció-vezérlési módszerekkel felfedezett jellemzők értelmezhetők-e. A „finding experts” nevű, korábbi aktiváció-vezérlési kutatásokból származó eljárással olyan neuronokat azonosítottak, amelyek meghatározott fogalmakért felelősek. Példaként a „macska” fogalmát említik.

Az ExpertLens ezeknek a neuronoknak a vizsgálatára épül. A kutatók szerint ez betekintést adhat abba, hogyan reprezentálják a modellek a fogalmakat.

Az eredmények több modellen és adatkészleten is stabilak voltak

A tanulmány szerint az ExpertLens által feltárt reprezentációk stabilnak bizonyultak különböző modellek és adatkészletek használata mellett is. A kutatók ezeket a reprezentációkat emberi viselkedési adatokból következtetett fogalmi reprezentációkkal vetették össze.

Az Apple kutatói úgy találták, hogy az ExpertLens eredményei szorosan igazodnak az emberi reprezentációkhoz. Az egyezés szintje elérte az emberek közötti igazodás mértékét. A vizsgálatban az ExpertLens az egyezés szempontjából jelentősen felülmúlta a szó- és mondatbeágyazások (word/sentence embeddings) által elért szintet.

A kutatók az emberi fogalmi szerveződés ExpertLens segítségével történő rekonstrukciójával azt mutatták be, hogy az eljárás részletes képet adhat arról, miként jelennek meg a fogalmak a nagy nyelvi modellekben.

Könnyű és rugalmas elemzési módszer lehet

A tanulmány következtetése szerint az ExpertLens rugalmas és könnyű megközelítést kínál a modellreprezentációk rögzítésére és elemzésére. Ez az aktiváció-vezérlés kutatásában azért fontos, mert a módszerrel azonosított neuronok vizsgálata közvetlenebb képet adhat a modellekben tárolt vagy feldolgozott fogalmakról.

A tanulmányt Masha Fedzechkina, Eleonora Gualdoni, Sinead Williamson, Katherine Metcalf, Skyler Seto és Barry-John Theobald jegyzi. A dolgozatot 2025 novemberében publikálták, és elfogadták a NeurIPS 2025 keretében megrendezett Workshop on Unifying Representations in Neural Models, vagyis UniReps műhelybe.

Az Apple kutatási oldala 2026. szeptember 18-án közölte az anyagot. A forrás alapján az ExpertLens elsősorban kutatási eszköz a nagy nyelvi modellek belső reprezentációinak elemzésére. A bemutatott eredmények azt támasztják alá, hogy az aktiváció-vezérléssel azonosított jellemzők emberi viselkedési adatokhoz is kapcsolható, részletes vizsgálati alapot adhatnak.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…