Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A gondolkodó AI-modelleket érdemes lehet jóval tovább tanítani

2026. augusztus 18. 17:06Forrás: Snorkel AI
A gondolkodó AI-modelleket érdemes lehet jóval tovább tanítani
Kép: Snorkel AI

A tesztidős következtetés (test-time reasoning) alapjaiban módosíthatja, hogyan érdemes nyelvi modelleket tanítani. A Snorkel AI kutatói szerint a számítási szempontból optimális megoldás sok esetben egy kisebb modell, amelyet a megszokottnál jóval több adaton képeznek.

A lényeg röviden
  • A T² skálázási törvény a modellméretet, a tanítási adatot és a tesztidős mintavételezést együtt optimalizálja.
  • A tesztidős következtetés kisebb, több adaton tanított modellek felé tolhatja az optimális választást.
  • A Chinchilla ökölszabálya nagyjából 20 tanítási token paraméterenként.
  • A Liquid AI LFM2.5-350M modellje 350 millió paraméterrel és 28 billió tokennel készült.
  • A kutatók szerint a veszteségalapú modell valamivel jobban extrapolált a túltréningezett tartományba.

A Chinchilla-szabály már nem ad teljes képet

A Snorkel AI Reading Group augusztus 18-i bejegyzése szerint Nicholas Roberts mutatta be a Test-Time Scaling Makes Overtraining Compute-Optimal című kutatást, amelynek társszerzői Sungjun Cho, Zhiqi Gao, Tzu-Heng Huang, Albert Wu, Gabriel Orlanski, Avi Trost, Kelly Buchanan, Aws Albarghouthi és Frederic Sala.

A hagyományos előtanítási skálázási törvények azt vizsgálják, hogyan osszunk el egy rögzített számítási keretet a modell mérete és a tanítóadat mennyisége között. A Chinchilla néven ismert irányelv gyakorlati ökölszabálya nagyjából 20 tanítási token paraméterenként.

A kutatók szerint ez a megközelítés önmagában már nem írja le pontosan a modern gondolkodó rendszereket, mivel ezek a válaszadás közben is jelentős számítási kapacitást használhatnak fel.

A Train-to-Test három tényezőt kapcsol össze

A tanulmány bevezeti a Train-to-Test, röviden T² skálázási törvényeket. Ezek egyszerre optimalizálják a modell méretét, a tanítási tokenek számát és a tesztidőben előállított minták mennyiségét.

A vizsgált módszerek közül a kutatók a párhuzamos mintavételezésre összpontosítottak. Ilyenkor a modell több, egymástól független választ generál, ezeket egy ellenőrző segítségével értékelik, majd kiválasztanak egy olyan választ, amely átmegy az ellenőrzésen.

A teljesítményt gyakran a pass@k mutatóval mérik. Ha a modell k darab választ készít, annak valószínűsége, hogy legalább az egyik helyes lesz, a minták számának növelésével emelkedik. A kutatás ezt a tesztidős költséget kapcsolja össze az előtanítás költségével.

A nagyobb modellek egy-egy előreirányú futtatása drágább, ezért azonos következtetési keret mellett a kisebb modellek több mintát tudnak előállítani. A szerzők az inferencia költségét a Cinf = 2Nk közelítéssel írják le, ahol N a modell mérete, k pedig a minták száma.

A kisebb modellek több adattal lehetnek hatékonyabbak

A nyolc vizsgált downstream feladaton a kutatók arra jutottak, hogy a tesztidős számítás figyelembevétele élesen eltolja az optimális választ. A T² skálázás kisebb modellek felé mutat, amelyeket a standard Chinchilla-ajánláshoz képest lényegesen több adaton tanítanak.

A szerzők kétféle modellt használtak. Az egyik a veszteséget egészíti ki a tesztidőben felhasznált minták számát leíró hatványfüggvényes taggal, a másik közvetlenül a pass@k értéket modellezi béta-regresszióval. Bár a két megközelítés eltérő mennyiségeket ír le, kvalitatív következtetésük megegyezett: a gondolkodó rendszerek esetében jelentős túltréning lehet számítási szempontból előnyös.

A Snorkel AI példaként említi a Liquid AI által kiadott LFM2.5-350M modellt, amely 350 millió paraméterrel és 28 billió tanítási tokennel készült. Ez körülbelül 80 000 token paraméterenként, vagyis jóval meghaladja a Chinchilla nagyjából 20 tokenes ökölszabályát. A kutatók szerint ez a modell közel esik ahhoz a tartományhoz, amelyet a T² előrejelzése az inferencia szempontjából hatékony gondolkodó rendszerekhez jelez.

A kutatók túltréningezett modelleken is tesztelték az előrejelzést

A szerzők azt is vizsgálták, hogy a skálázási törvény képes-e előre jelezni a létrehozásakor nem használt, erősen túltréningezett ellenőrzőpontok viselkedését. Ezeket a modelleket kihagyták az illesztésből, majd megvizsgálták, hogy a törvény képes-e extrapolálni ebbe a tartományba.

A kihagyott ellenőrzőpontok nagyjából követték az előre jelzett trendet. A veszteségalapú megközelítés valamivel jobban extrapolált, mint a pontosságalapú változat, ezért a Snorkel AI szerint a gyakorlatban előnyösebb lehet a paraméteres veszteségmodell használata. A megállapítás a modellfejlesztők számára azt jelenti, hogy a tesztidős következtetést már az előtanítási stratégia megtervezésekor figyelembe kell venni.

Kapcsolódó hírek

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4. 13:41

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2. 20:07

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára
Kutatás2026. szeptember 30. 03:57

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára

Kilenc, a RIKEN Center for Advanced Intelligence Project kutatóinak közreműködésével készült tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára. További hét…