Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple LaCy módszere megtanítja a kis nyelvi modelleket segítséget kérni

2026. július 6.Forrás: Apple
Az Apple LaCy módszere megtanítja a kis nyelvi modelleket segítséget kérni
Kép: Apple

Az Apple kutatói bemutatták a LaCy nevű előtanítási módszert, amely segít a kis nyelvi modelleknek eldönteni, mely tokeneket tanulják meg, és mikor kérjenek segítséget egy nagyobb modelltől vagy külső forrástól. A kutatás szerint ezt a döntést önmagában a veszteségfüggvény nem tudja megfelelően leírni.

A lényeg röviden
  • A LaCy kis nyelvi modellek előtanítására szolgáló módszer.
  • A rendszer a <CALL> tokennel jelzi, mikor kérjen külső segítséget.
  • A kutatás szerint a veszteségfüggvény önmagában nem elég a döntéshez.
  • A spaCy nyelvtani elemző kiegészíti a veszteség jelét.
  • Az Apple szerint a LaCy kaszkádban magasabb FactScore-t ért el, mint több összehasonlított módszer.

A kis modellek kapacitása korlátozott

A nyelvi modellek egyre több, a paramétereikben tárolt világismeretet próbálnak tömöríteni. Ennek azonban határt szab a modell paraméterszáma. A kis nyelvi modellek, vagyis SLM-ek kapacitása korlátozott, ezért gyakrabban állíthatnak elő tényszerűen hibás szöveget.

A problémát gyakran úgy kezelik, hogy a kis modell külső forráshoz fér hozzá. Ilyen forrás lehet egy nagyobb modell, dokumentum vagy adatbázis. Az Apple kutatása azt vizsgálja, hogy az SLM-eknek mit kellene megtanulniuk az előtanítás során, és mely tokenek előállítását kellene egy külső segítségre hagyniuk. A rendszer erre a célra egy <CALL> tokent használ.

A veszteség önmagában nem elég

A kutatók szerint a veszteség, vagyis a modell előrejelzésének és a helyes tokennek az eltérése, jelzi, hogy egy előrejelzés várhatóan hibás lesz-e. Ez a jel azonban nem minden esetben elég annak eldöntésére, hogy a modellnek segítséget kell-e kérnie.

Egy tokenhez ugyanis több, az előtanítási dokumentummal összhangban álló, igaz állítás is tartozhat. Ilyenkor a modell olyan folytatást is előállíthat, amelynek magas a vesztesége, mégis igaz. A LaCy megközelítése ezért nem minden magas veszteségű tokennél kezdeményez külső hívást. A módszer a veszteség jelét egy spaCy nyelvtani elemző segítségével egészíti ki, és ennek alapján választja szét a megtanulandó, illetve delegálandó tokeneket.

A LaCy külső segítséggel működő modellekhez készült

A LaCy egy olyan új előtanítási módszer, amely ezt a tokenkiválasztási elvet követi. Az Apple közlése szerint a kísérletekben a LaCy modellek megtanulták, mely tokeneket kell előre jelezniük, és mely pontokon kell segítséget kérniük.

A nagyobb modellel kaszkádban működő LaCy rendszerek magasabb FactScore-értékeket értek el. A forrás szerint a módszer felülmúlta a Rho vagy az LLM-judge segítségével tanított kis nyelvi modelleket, miközben egyszerűbb és olcsóbb volt.

A tanulmány címe LaCy: What Small Language Models Can and Should Learn is Not Just a Question of Loss. A szerzők Szilvia Ujváry, Louis Béthune, Pierre Ablin, João Monteiro, Marco Cuturi és Michael Kirchhof. A tanulmányt az ICLR Memory for LLM-Based Agentic Systems workshopja fogadta el, és 2026 áprilisában publikálták. Szilvia Ujváry a Cambridge-i Egyetemhez kötődik, a munkát pedig az Apple-nél végezte.

A kutatás felhasználói és fejlesztői szempontból azt az irányt erősíti, amelyben egy kisebb modell a könnyebben kezelhető feladatokat helyben oldja meg, a bizonytalanabb tokeneknél pedig nagyobb modellhez, dokumentumhoz vagy adatbázishoz fordul. A forrás alapján a LaCy célja ennek a döntésnek a pontosabbá tétele, miközben a szerzők egyszerűbb és olcsóbb megoldásként írják le a módszert.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket
Kutatás2026. szeptember 30.

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket

Közös, szelektív tartós memóriát mutat be az Apple kutatási anyaga az ügynökalapú LLM-rendszerekhez, amelyek több lépésben, eszközhasználattal állítanak elő kódot. A…