Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatói azt vizsgálták, mennyire marad meg a fastruktúrájú információ, amikor a nyelvi modellek természetes nyelven adják tovább egymásnak. Eredményeik szerint a kommunikációs csatorna veszteséges és aszimmetrikus, a hibák legalább 73,6 százaléka pedig a generálásnál keletkezik.
- A modellek közötti természetes nyelvű átadás veszteséges és aszimmetrikus.
- A generátor és a kivonó sorrendje akár 60,4 százalékpontos eltérést okozhat.
- A legjobb modellpáros 92,9 százalékos pontosságot ért el.
- A hibák legalább 73,6 százaléka a generálásnál keletkezett.
- Körülbelül 3600 finomhangolási példa minden nyílt súlyú modellt javított.
Kísérlet a strukturált információ átadására
Az Apple kutatása a láncolt gondolkodásban és a szabad szöveges köztes eredményekben használt kommunikáció egyik korlátját vizsgálja. A nyelvi modellek ilyenkor strukturált információt, például egymásba ágyazott műveleteket, természetes nyelvre alakítanak át. A tanulmány azt mérte, hogy ebből a fastruktúrájú, összetett tartalomból mennyi marad meg az átadás során.
A kutatók ehhez úgynevezett körkörös, vagyis round-trip protokollt alkalmaztak. Egy generátor egy eljárással létrehozott számtani kifejezést szöveges feladattá alakított. Ezután egy külön kivonó modell, kizárólag a szöveges feladat alapján, megpróbálta visszaállítani az eredeti kifejezést. A visszaállítás helyességét szimbolikus ekvivalenciával ellenőrizték, így pontosan meg tudták állapítani, hogy a két kifejezés matematikailag azonos-e.
A vizsgálatban tizenhat modell minden páros kombinációját értékelték. Az így létrehozott kommunikációs mátrix külön választotta a generálás minőségét a kivonás minőségétől.
A generálás a leggyakoribb hibaforrás
Az Apple szerint a természetes nyelvű kommunikációs csatorna veszteséges és aszimmetrikus. Ez azt jelenti, hogy számít, melyik modell készíti a szöveget, és melyik próbálja abból visszanyerni a strukturált kifejezést. A két modell sorrendjének felcserélése akár 60,4 százalékpontos pontosságváltozást is okozhat.
A legjobb páros 92,9 százalékos eredményt ért el. Ehhez különböző modelleket használtak a generálás és a kivonás oldalán, vagyis ugyanannak a modellnek a két végponton való alkalmazása nem minden esetben bizonyult a legerősebb megoldásnak.
A kutatás szerint a körkörös átadás hibáinak legalább 73,6 százaléka a generálásból származik. A nehézséget elsősorban a fa szerkezete határozta meg, ezen belül a műveletek száma, a mélység és a jobbra ágazás. Az Apple beszámolója alapján ez erősebb tényezőnek bizonyult, mint az, hogy a modellek mely családhoz tartoznak.
Finomhangolással javítható az átadás
A szerzők azt is megvizsgálták, hogy tanítható-e ez a kommunikációs csatorna. Körülbelül 3600 finomhangolási példát használtak, amelyekben az értékelés során alkalmazott műveletek és faszerkezetek is szerepeltek. Ez minden nyílt súlyú modellt a tanítatlan Gemini-3.1-Pro eredménye fölé emelt. A kutatók ezt összehangolt jelentés mellett érvényes felső korlátnak tekintették.
Egy másik beállításban új műveleteket és új szókincset használtak, amelyek nem fedték át az értékelés tartományát. Ebben a helyzetben is javult minden nyílt súlyú modell teljesítménye. A tanulmány szerint ez arra utal, hogy a javulás nem pusztán az egyező jelentésű tanítási és értékelési példák hatásából ered, bár a legjobb modellek szintjéhez továbbra is különbség maradt.
A szeptemberben közzétett, NeurIPShez kapcsolódó tanulmány szerzői Xavier Suau, Alex Ferrando de las Morenas, Luca Zappella és Samy Bengio. Következtetésük szerint a fastruktúrájú kifejezések természetes nyelvi szerializálása, vagyis szöveges formába öntése, elsődleges korlátozó tényező lehet akkor, amikor a modellek hierarchikus információt osztanak meg egymással.


