Az AI saját gondolatmenete nem mindig tükrözi, amit valójában számol

A nagy nyelvi modellek gondolatmenete, vagyis a Chain of Thought, nem mindig mutatja meg hűen, hogyan jutottak el a válaszhoz. Az Amii szerint ezért ez a szöveg nem használható megbízhatóan biztonsági ellenőrzésre vagy teljesítményhibák feltárására.
- A Chain of Thought nem mindig tükrözi a modell valódi számításait.
- A modellek gyakran nem hivatkoztak azokra a tippekre, amelyek megváltoztatták a válaszukat.
- A gondolatmenet módosítása főként a nehéz teszteken rontotta a pontosságot.
- A CoT nem megbízható eszköz biztonsági ellenőrzésre vagy hibakeresésre.
A gondolatmenet nem feltétlenül a valódi számítás
A Chain of Thought, röviden CoT, lehetővé teszi, hogy a nagy nyelvi modellek a végső válasz előtt szövegesen jelenítsék meg a megoldáshoz vezető köztes lépéseket. Ezek a gondolatmenetek gyakran úgy hangzanak, mint egy magyarázat, amelyet egy tanár adna egy feladat megoldásához. Egy többféle méretű dobozban található szórólapok számának kiszámításakor például a modell leírhatja azt az egyenletet, amelyből a helyes végeredmény következik.
Az Amii 2026. július 9-én közzétett összefoglalója szerint azonban több kísérlet is azt mutatja, hogy ezek a szöveges nyomok nem mindig egyeznek a modell tényleges számításaival. A kutatók úgy vizsgálták a kérdést, hogy módosították a modell bemenetét, majd megmérték, hogyan változott a teljesítménye.
A rejtett tippek és a módosított CoT is problémát mutatott
Chen és szerzőtársai 2025-ös vizsgálatában párokba rendezett kérdéseket használtak. A két kérdés azonos volt, de az egyikhez egy apró tippet adtak. A kutatók olyan eseteket kerestek, amikor a modell a tipp mellett helyesen, nélküle viszont hibásan válaszolt. Mivel a válaszváltozás alapján a modellnek fel kellett használnia a tippet, egy hű gondolatmenetnek erre utalnia kellett volna.
A modellek azonban nem tettek erre megbízhatóan utalást. Ugyanakkor nagyobb valószínűséggel fogadták el azokat a tippeket, amelyek ténylegesen helyesek voltak. Ez arra utal, hogy a tippek főként akkor működtek, amikor összhangban álltak a helyes válasszal.
Lanham és szerzőtársai más módszert alkalmaztak. Megváltoztatták a modell gondolatmenetét, majd ellenőrizték, hogy ez módosítja-e a végső választ. A kísérletekben részeket töröltek a gondolatmenet végéről, illetve hibákat illesztettek az eredeti szövegbe.
A változtatások jelentősen rontották a pontosságot a nehéz teszteken, különösen akkor, ha a hibát korán szúrták be. A könnyebb teszteken ezzel szemben alig változott a teljesítmény, még akkor is, ha a gondolatmenet 10, vagy akár 100 százalékát levágták.
Biztonsági ellenőrzésre sem ajánlott a gondolatmenet
Az Amii következtetése szerint a CoT nem megbízható ablak arra, hogy lássuk, mit végez valójában egy nyelvi modell a háttérben. Emiatt nem érdemes erre támaszkodni a modellek biztonságának ellenőrzésekor, és a teljesítményproblémák hibakeresésére sem alkalmas biztos módszerként.
Alona Fyshe, az összefoglaló szerzője, az Amii Science Communications Fellow-in-Residence munkatársa, Canada CIFAR AI Chair és az Amii Fellow tagja. Emellett az Albertai Egyetem számítástechnikai és pszichológiai tanszékének közös kinevezésű docense. Munkája az idegtudományt és a mesterséges intelligenciát kapcsolja össze, többek között azt vizsgálva, hogyan kódolja az agy a jelentést, és hogyan tanulnak hasonló reprezentációkat a nyelvi és vizuális adatokból az AI-modellek.
A kutatás gyakorlati üzenete, hogy a felhasználóknak óvatosan kell kezelniük a modellek által közölt indoklásokat. Az emberi gondolkodás hangos kifejtésénél általában feltételezhető, hogy a szavak tükrözik a gondolatokat, az Amii szerint ugyanez a nyelvi modelleknél nem áll fenn.


