Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új memóriarchitektúrával csökkentené a nyelvi modellek méretét

2026. szeptember 30.Forrás: Apple
Az Apple új memóriarchitektúrával csökkentené a nyelvi modellek méretét
Kép: Apple

Az Apple kutatói hierarchikus memóriákra épülő nyelvimodell-architektúrát mutattak be. A megközelítés a ritkábban előforduló tudást külön paraméteres memóriabankokban tárolja, miközben a kisebb nyelvi modell az általános tudásért és következtetésért felel.

A lényeg röviden
  • Az Apple hierarchikus paraméteres memóriabankokat társít kisebb nyelvi modellekhez.
  • A ritka világtudás a memóriában, a gyakori tudás és a következtetés a modellben kap helyet.
  • Egy 160 millió paraméteres modell 18 millió paraméteres memóriát használt egy 4,6 milliárdos bankból.
  • Az Apple szerint az eredmény egy több mint kétszer nagyobb hagyományos modell teljesítményéhez volt hasonló.
  • A javasolt memóriákat több mint 21 milliárd paraméteres méretig vizsgálták.

Különválasztanák a gyakori és a ritka tudást

Az Apple kutatása szerint a modern nyelvi modellek teljesítménynövekedése jelenleg nagyrészt a paraméterszám növelésére épül. A nagyobb modellek több világról szóló tudást képesek tárolni, és jobban következtetnek, ugyanakkor egy adott kérdéshez ennek a tudásnak csak egy része szükséges.

A kutatók ezért memória-kiegészített architektúrát és ehhez igazított előtanítási módszert javasolnak. A rendszer kis nyelvi modellekhez nagy, hierarchikus paraméteres memóriabankokat társít. Az előtanítás és a használat során a modell egy kis, az aktuális kontextustól függő memóriablokkot kér le, majd ezt hozzáadja a nyelvi modellhez.

A módszerben a ritka, hosszú farokhoz tartozó világtudás a memória paramétereiben kap helyet. A kisebb nyelvi modell közben horgonyként működik, és a közös, gyakori tudást, valamint az általános következtetési képességeket fogja össze.

Egy 160 millió paraméteres modell eredményei

Az Apple közleménye szerint a kutatók billió tokenes léptékű kísérleteket végeztek. Ezekben egy 160 millió paraméteres, memóriával kiegészített modell 18 millió paraméteres memóriát használt egy 4,6 milliárd paraméteres memóriabankból.

A kutatók állítása szerint ez a rendszer összehasonlítható teljesítményt ért el egy olyan hagyományos modellel, amely több mint kétszer ennyi paraméterrel rendelkezik. A kísérletek célja annak vizsgálata is volt, hogy a transzformerekben milyen típusú és méretű paraméteres memóriák működnek a legjobban.

A memóriákat a vizsgálatok során több mint 21 milliárd paraméteres méretig skálázták. Az Apple szerint a kutatók által javasolt hierarchikus, előrecsatolt memóriák különböző transzformer-architektúrák mellett is stabilan működtek. A megoldás alkalmazható az előtanítás részeként, illetve utólagos kiegészítésként is.

Kisebb modellek korlátozott erőforrású eszközökön

A kutatás egyik kiindulópontja, hogy a teljes világtudás paraméterekbe sűrítése gyakorlati szempontból sem mindig célszerű. Az Apple szerint ez különösen a peremhálózati eszközöknél jelenthet problémát, ahol a használat közbeni memória és a számítási kapacitás korlátozott.

A hierarchikus memóriák célja, hogy egy kisebb nyelvi modell csak a feladathoz szükséges memóriablokkot érje el, ahelyett hogy minden tudást egyetlen nagy modell paramétereiben kellene tárolni. A forrás alapján a megközelítés így a tudás tárolását és a modell általános képességeit külön kezeli.

A tanulmány címe: Pretraining with Hierarchical Memories: Separating Long-Tail and Common Knowledge. Szerzői Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof és Oncel Tuzel. A tanulmány az Apple kutatási oldalán a tudásbázisok és keresés, valamint a módszerek és algoritmusok területén szerepel, konferenciája az ICLR, tartalomtípusa pedig kutatási dolgozat.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…