Az Apple LaCy módszere megtanítja a kis nyelvi modelleket segítséget kérni

Az Apple kutatói bemutatták a LaCy nevű előtanítási módszert, amely segít a kis nyelvi modelleknek eldönteni, mely tokeneket tanulják meg, és mikor kérjenek segítséget egy nagyobb modelltől vagy külső forrástól. A kutatás szerint ezt a döntést önmagában a veszteségfüggvény nem tudja megfelelően leírni.
- A LaCy kis nyelvi modellek előtanítására szolgáló módszer.
- A rendszer a <CALL> tokennel jelzi, mikor kérjen külső segítséget.
- A kutatás szerint a veszteségfüggvény önmagában nem elég a döntéshez.
- A spaCy nyelvtani elemző kiegészíti a veszteség jelét.
- Az Apple szerint a LaCy kaszkádban magasabb FactScore-t ért el, mint több összehasonlított módszer.
A kis modellek kapacitása korlátozott
A nyelvi modellek egyre több, a paramétereikben tárolt világismeretet próbálnak tömöríteni. Ennek azonban határt szab a modell paraméterszáma. A kis nyelvi modellek, vagyis SLM-ek kapacitása korlátozott, ezért gyakrabban állíthatnak elő tényszerűen hibás szöveget.
A problémát gyakran úgy kezelik, hogy a kis modell külső forráshoz fér hozzá. Ilyen forrás lehet egy nagyobb modell, dokumentum vagy adatbázis. Az Apple kutatása azt vizsgálja, hogy az SLM-eknek mit kellene megtanulniuk az előtanítás során, és mely tokenek előállítását kellene egy külső segítségre hagyniuk. A rendszer erre a célra egy <CALL> tokent használ.
A veszteség önmagában nem elég
A kutatók szerint a veszteség, vagyis a modell előrejelzésének és a helyes tokennek az eltérése, jelzi, hogy egy előrejelzés várhatóan hibás lesz-e. Ez a jel azonban nem minden esetben elég annak eldöntésére, hogy a modellnek segítséget kell-e kérnie.
Egy tokenhez ugyanis több, az előtanítási dokumentummal összhangban álló, igaz állítás is tartozhat. Ilyenkor a modell olyan folytatást is előállíthat, amelynek magas a vesztesége, mégis igaz. A LaCy megközelítése ezért nem minden magas veszteségű tokennél kezdeményez külső hívást. A módszer a veszteség jelét egy spaCy nyelvtani elemző segítségével egészíti ki, és ennek alapján választja szét a megtanulandó, illetve delegálandó tokeneket.
A LaCy külső segítséggel működő modellekhez készült
A LaCy egy olyan új előtanítási módszer, amely ezt a tokenkiválasztási elvet követi. Az Apple közlése szerint a kísérletekben a LaCy modellek megtanulták, mely tokeneket kell előre jelezniük, és mely pontokon kell segítséget kérniük.
A nagyobb modellel kaszkádban működő LaCy rendszerek magasabb FactScore-értékeket értek el. A forrás szerint a módszer felülmúlta a Rho vagy az LLM-judge segítségével tanított kis nyelvi modelleket, miközben egyszerűbb és olcsóbb volt.
A tanulmány címe LaCy: What Small Language Models Can and Should Learn is Not Just a Question of Loss. A szerzők Szilvia Ujváry, Louis Béthune, Pierre Ablin, João Monteiro, Marco Cuturi és Michael Kirchhof. A tanulmányt az ICLR Memory for LLM-Based Agentic Systems workshopja fogadta el, és 2026 áprilisában publikálták. Szilvia Ujváry a Cambridge-i Egyetemhez kötődik, a munkát pedig az Apple-nél végezte.
A kutatás felhasználói és fejlesztői szempontból azt az irányt erősíti, amelyben egy kisebb modell a könnyebben kezelhető feladatokat helyben oldja meg, a bizonytalanabb tokeneknél pedig nagyobb modellhez, dokumentumhoz vagy adatbázishoz fordul. A forrás alapján a LaCy célja ennek a döntésnek a pontosabbá tétele, miközben a szerzők egyszerűbb és olcsóbb megoldásként írják le a módszert.


