Az Apple kisebb nyelvi modelleket kapcsolna nagy memóriabankokhoz

Az Apple kutatói olyan nyelvimodell-architektúrát és előtanítási módszert mutattak be, amely a ritka, hosszú farokhoz tartozó tudást külön paraméteres memóriában tárolja. A megközelítés célja, hogy kisebb modellek férjenek hozzá nagy tudásbankokhoz, miközben a modell maga az általános tudásra és következtetésre összpontosít.
- Az Apple kutatói hierarchikus, paraméteres memóriabankokat kapcsolnának kis nyelvi modellekhez.
- A rendszer kontextusfüggően csak egy kis memóriablokkot kér le.
- A ritka tudás a memóriába, a közös tudás és a következtetés az alapmodellbe kerülhet.
- Egy 160 millió paraméteres modell 18 millió paraméteres memóriával hasonlóan teljesített, mint egy több mint kétszer nagyobb hagyományos modell.
- A hierarchikus előrecsatolt memóriákat 21 milliárd paraméternél nagyobb méretig vizsgálták.
A tudást külön memóriába szerveznék
Az Apple kutatási oldala szerint a modern nyelvi modellek teljesítménynövekedése jelenleg nagyrészt a paraméterszám növelésére épül. A nagyobb modellek több, a világról szóló tudást képesek tárolni, és jobban következtetnek. A kutatók szerint azonban nem szükséges minden ismeretet a modell paramétereibe sűríteni, mivel egy adott kérés során ezeknek csak egy része kerül felhasználásra.
Ez a megoldás különösen korlátozott, futás közbeni memóriával és számítási kapacitással rendelkező peremközeli eszközöknél lehet fontos. Az Apple kutatói memória-kiegészített architektúrát és ehhez igazított előtanítási stratégiát javasolnak. A rendszer kis nyelvi modelleket kapcsol nagy, hierarchikus paraméteres memóriabankokhoz, amelyek a világról szóló ismereteket kódolják.
Csak a szükséges memóriablokk kerül elő
A módszer lényege, hogy előtanításkor és következtetéskor a rendszer egy kis, az adott kontextustól függő memóriablokkot kér le, majd ezt hozzáadja a modellhez. Így a teljes memóriabanknak nem kell minden egyes kérésnél aktívnak lennie.
Az előtanítás során a rendszer a ritka, hosszú farokhoz tartozó világtudást a memória paramétereiben igyekszik elhelyezni. A kisebb nyelvi modell ezzel párhuzamosan horgonyként működik: a gyakori tudást, valamint az általános következtetési képességeket hordozza. A kutatás címe, Pretraining with Hierarchical Memories: Separating Long-Tail and Common Knowledge, erre a tudásmegosztásra utal.
A tanulmány szerzői Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof és Oncel Tuzel. A munka az ICLR konferenciához kapcsolódik, és az Apple kutatási oldalán a tudásbázisok és keresés, valamint a módszerek és algoritmusok területén szerepel.
A bemutatott kísérletek eredményei
Az Apple közlése szerint a kutatók ezermilliárd token léptékű kísérleteket végeztek. Ezekben egy 160 millió paraméteres modellhez 18 millió paraméteres, lekért memóriát kapcsoltak egy 4,6 milliárd paraméteres memóriabankból. A beszámoló szerint ez a rendszer hasonló teljesítményt ért el, mint egy olyan hagyományos modell, amelynek paraméterszáma több mint kétszer nagyobb.
A kutatók emellett kiterjedt kísérletekben vizsgálták, hogy a transzformerekben milyen típusú és méretű paraméteres memóriák működnek a legjobban. A memóriákat 21 milliárd paraméternél nagyobb méretig skálázták. Megállapításuk szerint az általuk javasolt hierarchikus, előrecsatolt memóriák különböző transzformer-architektúrákban is robusztusan működnek.
A forrás alapján a megoldás akkor is alkalmazható, ha a memóriát már az előtanítás során hozzáadják a rendszerhez, és akkor is, ha ezt utólag, úgynevezett post-hoc módon teszik meg.
Mit jelenthet ez a felhasználók számára?
A kutatás olyan modellfelépítést vázol, amelyben a kisebb nyelvi modellnek nem kell a teljes világtudást saját paramétereiben tárolnia. A kontextus alapján lekért memóriablokkok révén a rendszer nagyobb tudásbankhoz férhet hozzá, miközben az alapmodell mérete alacsonyabb maradhat.
Az Apple közlése nem egy kész termék vagy konkrét eszköz bejelentéséről szól, hanem egy kutatási módszert mutat be. A bemutatott eredmények alapján a hierarchikus memóriák az előtanítás és a következtetés során is használhatók, továbbá a megközelítés a korlátozott futásidejű memóriával és számítási kapacitással rendelkező eszközök szempontjából is releváns kutatási irányt jelenthet.


