Az Apple új memóriarchitektúrával csökkentené a nyelvi modellek méretét

Az Apple kutatói hierarchikus memóriákra épülő nyelvimodell-architektúrát mutattak be. A megközelítés a ritkábban előforduló tudást külön paraméteres memóriabankokban tárolja, miközben a kisebb nyelvi modell az általános tudásért és következtetésért felel.
- Az Apple hierarchikus paraméteres memóriabankokat társít kisebb nyelvi modellekhez.
- A ritka világtudás a memóriában, a gyakori tudás és a következtetés a modellben kap helyet.
- Egy 160 millió paraméteres modell 18 millió paraméteres memóriát használt egy 4,6 milliárdos bankból.
- Az Apple szerint az eredmény egy több mint kétszer nagyobb hagyományos modell teljesítményéhez volt hasonló.
- A javasolt memóriákat több mint 21 milliárd paraméteres méretig vizsgálták.
Különválasztanák a gyakori és a ritka tudást
Az Apple kutatása szerint a modern nyelvi modellek teljesítménynövekedése jelenleg nagyrészt a paraméterszám növelésére épül. A nagyobb modellek több világról szóló tudást képesek tárolni, és jobban következtetnek, ugyanakkor egy adott kérdéshez ennek a tudásnak csak egy része szükséges.
A kutatók ezért memória-kiegészített architektúrát és ehhez igazított előtanítási módszert javasolnak. A rendszer kis nyelvi modellekhez nagy, hierarchikus paraméteres memóriabankokat társít. Az előtanítás és a használat során a modell egy kis, az aktuális kontextustól függő memóriablokkot kér le, majd ezt hozzáadja a nyelvi modellhez.
A módszerben a ritka, hosszú farokhoz tartozó világtudás a memória paramétereiben kap helyet. A kisebb nyelvi modell közben horgonyként működik, és a közös, gyakori tudást, valamint az általános következtetési képességeket fogja össze.
Egy 160 millió paraméteres modell eredményei
Az Apple közleménye szerint a kutatók billió tokenes léptékű kísérleteket végeztek. Ezekben egy 160 millió paraméteres, memóriával kiegészített modell 18 millió paraméteres memóriát használt egy 4,6 milliárd paraméteres memóriabankból.
A kutatók állítása szerint ez a rendszer összehasonlítható teljesítményt ért el egy olyan hagyományos modellel, amely több mint kétszer ennyi paraméterrel rendelkezik. A kísérletek célja annak vizsgálata is volt, hogy a transzformerekben milyen típusú és méretű paraméteres memóriák működnek a legjobban.
A memóriákat a vizsgálatok során több mint 21 milliárd paraméteres méretig skálázták. Az Apple szerint a kutatók által javasolt hierarchikus, előrecsatolt memóriák különböző transzformer-architektúrák mellett is stabilan működtek. A megoldás alkalmazható az előtanítás részeként, illetve utólagos kiegészítésként is.
Kisebb modellek korlátozott erőforrású eszközökön
A kutatás egyik kiindulópontja, hogy a teljes világtudás paraméterekbe sűrítése gyakorlati szempontból sem mindig célszerű. Az Apple szerint ez különösen a peremhálózati eszközöknél jelenthet problémát, ahol a használat közbeni memória és a számítási kapacitás korlátozott.
A hierarchikus memóriák célja, hogy egy kisebb nyelvi modell csak a feladathoz szükséges memóriablokkot érje el, ahelyett hogy minden tudást egyetlen nagy modell paramétereiben kellene tárolni. A forrás alapján a megközelítés így a tudás tárolását és a modell általános képességeit külön kezeli.
A tanulmány címe: Pretraining with Hierarchical Memories: Separating Long-Tail and Common Knowledge. Szerzői Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof és Oncel Tuzel. A tanulmány az Apple kutatási oldalán a tudásbázisok és keresés, valamint a módszerek és algoritmusok területén szerepel, konferenciája az ICLR, tartalomtípusa pedig kutatási dolgozat.


