A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított mechanizmusokat használják. A kutatók szerint az értelmezéshez kontrollmodellekre és oksági tesztekre is szükség van.
- A Coconut és a CODI mellett kontrollmodelleket is vizsgáltak.
- A BFS-szerű és aritmetikai minták a kontrollmodellekben is megjelentek.
- A látens gondolatok hatása fokozatos, és oksági befolyásuk mértékével skálázódik.
- A kutatás szerint a dekódolhatóság önmagában nem bizonyít belső mechanizmust.
- Az LRM-ek értelmezéséhez kontrollmodellek és oksági tesztek szükségesek.
A folytonos gondolatok vizsgálata
A tanulmány a látens gondolkodási modelleket, vagyis az úgynevezett LRM-eket vizsgálja. Ezek a modellek a nyíltan megjelenő gondolatmenetet folytonos, rejtett állapotokkal váltják fel. A kutatás címe Observable patterns are not explanations: a causal-geometric analysis of latent reasoning models, magyarul nagyjából azt állítja, hogy a megfigyelhető minták önmagukban nem magyarázatok.
A kutatók, Darpan Aswal, Thomas Palmeira Ferraz, Yongxin Zhou és Maxime Peyrard két LRM-et, a Coconutot és a CODI-t elemezték. Ezek eredményeit olyan kontrollmodellekkel vetették össze, amelyekből hiányzott a vizsgált rekurencia vagy a tanítási folyamatban alkalmazott tanterv.
A vizsgálat hátterében az a megközelítés áll, amely bizonyos megfigyelhető látensállapot-mintákat belső gondolkodási mechanizmusok bizonyítékaként értelmez. Ilyen mintának számíthat például egy BFS-szerű frontvonal megjelenése vagy a dekódolható aritmetikai számítás.
A kontrollmodellekben is megjelentek a minták
A NAVER LABS Europe által közölt eredmények szerint ezek a minták a kontrollmodellekben is megjelentek. Ez azt jelenti, hogy a puszta megfigyelésükből nem lehet biztosan arra következtetni, hogy a modell a hozzájuk társított belső mechanizmust használja.
A kutatók azt is megállapították, hogy a minták nem minden esetben voltak oksági hatással a modell viselkedésére. A tanulmány ezért különbséget tesz a modell belső állapotaiban felismerhető szerkezet és aközött, hogy ez a szerkezet ténylegesen befolyásolja-e a választ.
Az oksági beavatkozások alapján a látens gondolatok használata nem bináris jelenség. A modell nem egyszerűen használja vagy nem használja ezeket az állapotokat, hanem a hatás fokozatosan változik. A használat mértéke azzal skálázódik, hogy egy adott gondolat mekkora oksági hatással van a modell viselkedésére.
Az értelmezéshez oksági tesztek kellenek
A geometriai elemzés szerint ez a hatás alacsony rangú irányokban összpontosul. Ezekben az irányokban a lépésről lépésre változó geometria strukturáltabbá válik, ahogy nő a látens állapot viselkedésre gyakorolt befolyása.
A tanulmány következtetése szerint a látens gondolatokat rejtett számításként kell kezelni, nem rejtett magyarázatként. Önmagában a dekódolhatóság, a figyelem eloszlása vagy egy statikus szerkezet nem bizonyítja, hogy milyen mechanizmus működik a modellben.
Ez a felhasználók számára azt jelenti, hogy egy modell belső állapotainak értelmezésekor a látható mintákból nem lehet automatikusan megbízható magyarázatot készíteni. A kutatók az LRM-ek értelmezéséhez összehangolt kontrollmodellek és oksági vizsgálatok használatát tartják szükségesnek. A tanulmányt az EMNLP konferencián mutatják be Budapesten, 2026. október 24. és 29. között.
NAVER LABS Europe: Observable patterns are not explanations: a causal-geometric analysis of latent reasoning models


