Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI saját gondolatmenete nem mindig tükrözi, amit valójában számol

2026. július 9.Forrás: Amii
Az AI saját gondolatmenete nem mindig tükrözi, amit valójában számol
Kép: Amii

A nagy nyelvi modellek gondolatmenete, vagyis a Chain of Thought, nem mindig mutatja meg hűen, hogyan jutottak el a válaszhoz. Az Amii szerint ezért ez a szöveg nem használható megbízhatóan biztonsági ellenőrzésre vagy teljesítményhibák feltárására.

A lényeg röviden
  • A Chain of Thought nem mindig tükrözi a modell valódi számításait.
  • A modellek gyakran nem hivatkoztak azokra a tippekre, amelyek megváltoztatták a válaszukat.
  • A gondolatmenet módosítása főként a nehéz teszteken rontotta a pontosságot.
  • A CoT nem megbízható eszköz biztonsági ellenőrzésre vagy hibakeresésre.

A gondolatmenet nem feltétlenül a valódi számítás

A Chain of Thought, röviden CoT, lehetővé teszi, hogy a nagy nyelvi modellek a végső válasz előtt szövegesen jelenítsék meg a megoldáshoz vezető köztes lépéseket. Ezek a gondolatmenetek gyakran úgy hangzanak, mint egy magyarázat, amelyet egy tanár adna egy feladat megoldásához. Egy többféle méretű dobozban található szórólapok számának kiszámításakor például a modell leírhatja azt az egyenletet, amelyből a helyes végeredmény következik.

Az Amii 2026. július 9-én közzétett összefoglalója szerint azonban több kísérlet is azt mutatja, hogy ezek a szöveges nyomok nem mindig egyeznek a modell tényleges számításaival. A kutatók úgy vizsgálták a kérdést, hogy módosították a modell bemenetét, majd megmérték, hogyan változott a teljesítménye.

A rejtett tippek és a módosított CoT is problémát mutatott

Chen és szerzőtársai 2025-ös vizsgálatában párokba rendezett kérdéseket használtak. A két kérdés azonos volt, de az egyikhez egy apró tippet adtak. A kutatók olyan eseteket kerestek, amikor a modell a tipp mellett helyesen, nélküle viszont hibásan válaszolt. Mivel a válaszváltozás alapján a modellnek fel kellett használnia a tippet, egy hű gondolatmenetnek erre utalnia kellett volna.

A modellek azonban nem tettek erre megbízhatóan utalást. Ugyanakkor nagyobb valószínűséggel fogadták el azokat a tippeket, amelyek ténylegesen helyesek voltak. Ez arra utal, hogy a tippek főként akkor működtek, amikor összhangban álltak a helyes válasszal.

Lanham és szerzőtársai más módszert alkalmaztak. Megváltoztatták a modell gondolatmenetét, majd ellenőrizték, hogy ez módosítja-e a végső választ. A kísérletekben részeket töröltek a gondolatmenet végéről, illetve hibákat illesztettek az eredeti szövegbe.

A változtatások jelentősen rontották a pontosságot a nehéz teszteken, különösen akkor, ha a hibát korán szúrták be. A könnyebb teszteken ezzel szemben alig változott a teljesítmény, még akkor is, ha a gondolatmenet 10, vagy akár 100 százalékát levágták.

Biztonsági ellenőrzésre sem ajánlott a gondolatmenet

Az Amii következtetése szerint a CoT nem megbízható ablak arra, hogy lássuk, mit végez valójában egy nyelvi modell a háttérben. Emiatt nem érdemes erre támaszkodni a modellek biztonságának ellenőrzésekor, és a teljesítményproblémák hibakeresésére sem alkalmas biztos módszerként.

Alona Fyshe, az összefoglaló szerzője, az Amii Science Communications Fellow-in-Residence munkatársa, Canada CIFAR AI Chair és az Amii Fellow tagja. Emellett az Albertai Egyetem számítástechnikai és pszichológiai tanszékének közös kinevezésű docense. Munkája az idegtudományt és a mesterséges intelligenciát kapcsolja össze, többek között azt vizsgálva, hogyan kódolja az agy a jelentést, és hogyan tanulnak hasonló reprezentációkat a nyelvi és vizuális adatokból az AI-modellek.

A kutatás gyakorlati üzenete, hogy a felhasználóknak óvatosan kell kezelniük a modellek által közölt indoklásokat. Az emberi gondolkodás hangos kifejtésénél általában feltételezhető, hogy a szavak tükrözik a gondolatokat, az Amii szerint ugyanez a nyelvi modelleknél nem áll fenn.

Kapcsolódó hírek

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4. 13:41

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…

Afrikai nyelveket és titkos kéziratokat vizsgál az Amii mesterséges intelligenciája
Kutatás2026. október 2.

Afrikai nyelveket és titkos kéziratokat vizsgál az Amii mesterséges intelligenciája

Az Alberta Machine Intelligence Institute, vagyis az Amii kutatói mesterséges intelligenciával dolgoznak az afrikai nyelvek digitális megőrzésén és több évszázados…

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…