Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google szerint a csúcsmodellek sok tényt tárolnak, de nem mindig hívják elő

2026. augusztus 12. 11:51Forrás: Google Research
A Google szerint a csúcsmodellek sok tényt tárolnak, de nem mindig hívják elő
Kép: Google Research

A Google Research 2026. augusztus 12-én bemutatott kutatása szerint a fejlett nagy nyelvi modellek ténybeli hibáinak jelentős része nem abból ered, hogy a modellek nem tárolták a tényt. A szerzők, Nitay Calderon és Gal Yona szerint a szűk keresztmetszet egyre inkább az előhívás.

A lényeg röviden
  • A Google Research a ténybeli hibákat kódolási és előhívási problémák szerint vizsgálja.
  • A WikiProfile benchmark 2 150 Wikipedia-alapú tényt és tényenként tíz feladatot tartalmaz.
  • A Gemini-3-Pro és a GPT-5 a tények 95-98%-át kódolja, de 26-34%-ukat nem hívja elő közvetlenül.
  • Gondolkodással is 11-12% marad azon tények aránya, amelyeken ezek a modellek hibáznak.
  • A kutatás szerint a ritka tények és a fordított kérdések főként előhívási nehézségeket mutatnak.

Mit vizsgál a Google Research új keretrendszere?

A Google Research blogján ismertetett munka, az Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality arra a kérdésre keresi a választ, hogy amikor egy nagy nyelvi modell rosszul válaszol egy ténykérdésre, akkor a tény hiányzik-e a modellből, vagy a modell már kódolta, csak nem tudja megbízhatóan előhívni.

A kutatók szerint a hagyományos pontossági mutatók ezeket az eseteket egy kategóriába sorolják, pedig eltérő problémákról van szó. Ha a gond a kódolás hiánya, akkor a modellméret növelése vagy az adatok bővítése lehet fontos. Ha viszont az előhívás hibázik, akkor olyan utótanítási és futás közbeni módszerek is segíthetnek, amelyek a már tárolt tudás jobb használatát célozzák.

A Google Research ehhez egy knowledge profiling nevű viselkedési keretrendszert vezet be. A módszer nem egyes kérdések pontosságát nézi elsődlegesen, hanem azt, hogy egy adott tény milyen állapotban van a modellben. A szerzők öt profilt különböztetnek meg: kódolási hiba, előhívási hiba, közvetlen előhívás, előhívás gondolkodással, valamint következtetés kódolás nélkül.

A WikiProfile 2 150 Wikipedia-alapú tényen méri a tudást

A keretrendszer méréséhez a Google Research létrehozta a WikiProfile nevű benchmarkot, amely 2 150, Wikipediából származtatott tényt tartalmaz. Minden tényhez tíz feladat tartozik: kettő a kódolás mérésére, négy a tudás értékelésére, és négy feleletválasztós változat a felismerés vizsgálatára.

A benchmark teljesen automatizált folyamatban készült, amelyet egy promptolt LLM, a Gemini-2.5-Pro with thinking támogatott. A promptokat egy kis, elkülönített részhalmazon kézzel optimalizálták. A jelölt tényeket Wikipedia-oldalakból nyerték ki: a forrás meghatározása szerint ezek olyan állítások, amelyekben rendezett entitáspár szerepel, és az alany előbb jelenik meg a dokumentumban.

A direkt és fordított kérdéseket háromlépcsős folyamatban állították elő: generálás, finomítás és szűrés után csak olyan kérdések maradtak, amelyek egyértelműek, specifikusak, minimálisak, és egyetlen helyes válaszuk van. A kérdéseket keresőmotoron alapuló szűrésnek is alávetették, és elvetették azokat az eseteket, ahol több válasz jelent meg, vagy pontosításra lett volna szükség. Az automatizált szűrés után végső kézi validálás következett.

A Gemini-3-Pro és a GPT-5 sok tényt kódol, de nem mindet éri el

A kutatók 13 nagy nyelvi modellt értékeltek, mindegyiket gondolkodási móddal és anélkül is. Minden modell, tény és feladat esetében nyolc választ mintavételeztek. A válaszokat promptolt LLM-alapú automatikus értékelők osztályozták, így összesen körülbelül 4,5 millió válasz keletkezett.

A Google Research fő eredménye szerint a vizsgált csúcsmodelleknél, köztük a Gemini-2.5-Pro, a Gemini-3-Pro és Flash, valamint a GPT-5 esetében, a tények kódolása közel telített, az előhívás azonban nem az. A Gemini-3-Pro és a GPT-5 a tények 95-98%-át kódolja, mégis a tények 26-34%-át nem tudja közvetlenül előhívni. Gondolkodással is 11-12%-os hibaarány marad.

A szerzők ezt úgy értelmezik, hogy a fejlett modellek ténybeli hibái egyre kevésbé a hiányzó tudásból, inkább a tárolt, de nem megbízhatóan hozzáférhető tudásból erednek. A Google Research megfogalmazása szerint a szűk keresztmetszet a tudás megszerzéséről a tudás hasznosítására tolódik.

A skálázás vizsgálata ezt a képet erősíti. A Gemma 3 családban a nagyobb modellek jóval kevesebb kódolási hibát mutatnak, de az előhívási hibák továbbra is jelentősek, és a fennmaradó hibák nagyobb részét adják. A forrás szerint a skálázás jobban javítja azt, hogy mit tárol a modell, mint azt, hogy mihez fér hozzá.

Ritka tények és fordított kérdések mutatják az előhívás gyengeségeit

A Google Research eredményei szerint az előhívás erősen függ attól, milyen körülmények között tanulta meg a modell az adott tényt. Ha a kérdés eltér a tanulási kontextustól, a megfogalmazástól vagy a sorrendtől, amelyben a tény előfordulhatott, az előhívás nehezebbé válik.

Az egyik vizsgált eset a ritka, hosszú farokba tartozó tényeké. A forrás szerint korábbi munkák gyakran modellkapacitási problémaként keretezték, hogy az LLM-ek nehezen kezelik ezeket a tényeket. A Google Research eredményei kiegészítő képet adnak: az alacsony és magas népszerűségű tények összevetésekor a ritka tények kódolási aránya közel van a népszerű tényekéhez, miközben az előhívási különbség nagyobb. A kutatók az alsó 20%-ot és a felső 20%-ot hasonlították össze népszerűség szerint.

A másik eset a fordított kérdések problémája, amelyet a forrás a reversal curse néven említ. A modellek nyílt végű generálásban, vagyis előhíváskor, következetesen nehezebben válaszolnak fordított kérdésekre, mint direkt kérdésekre. Feleletválasztós ellenőrzésben, vagyis felismeréskor azonban a fordított kérdések nem nehezebbek a direkt kérdéseknél, és gyakran könnyebbek is.

Ez a különbség a kutatók szerint azért fontos, mert ha egy modell a helyes választ felismeri a zavaró válaszok között, de nem tudja előállítani fordított kérdésre, akkor a probléma nem egyszerűen az, hogy hiányzik a kétirányú tudás. A hiba inkább az előhívás módjához kapcsolódik.

Mit jelent ez a felhasználóknak és a fejlesztőknek?

A kutatás gyakorlati üzenete, hogy a ténybeli megbízhatóság értékeléséhez önmagában a kérdésszintű pontosság kevés lehet. Ugyanaz a rossz válasz jelenthet hiányzó tudást, nehezen hozzáférhető tudást vagy olyan esetet, amikor a modell más tényekből következtet.

A felhasználói szempontból ez azt jelenti, hogy egy fejlett modell hibája nem feltétlenül annak jele, hogy az adott tény nincs jelen a modell paramétereiben. A Google Research eredményei alapján a modell sok esetben tárolhatja a tényt, de a megfogalmazás, a kérdés iránya vagy a kontextus miatt mégsem adja vissza megbízhatóan.

A fejlesztők számára a cikk azt jelzi, hogy a következő javítási irányok között nemcsak a nagyobb modellek és a több adat szerepelhet, hanem az olyan utótanítási és futás közbeni módszerek is, amelyek a már kódolt tudás jobb előhívását segítik. A Google Research keretrendszere ehhez diagnosztikai eszközt kínál: megmutatja, hogy egy tény hiányzik-e, közvetlenül elérhető-e, csak gondolkodással hívható-e elő, vagy felismerhető, de nehezen generálható.

Kapcsolódó hírek

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4. 13:41

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2. 20:07

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára
Kutatás2026. szeptember 30. 03:57

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára

Kilenc, a RIKEN Center for Advanced Intelligence Project kutatóinak közreműködésével készült tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára. További hét…