Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple kisebb nyelvi modelleket kapcsolna nagy memóriabankokhoz

2026. szeptember 30.Forrás: Apple
Az Apple kisebb nyelvi modelleket kapcsolna nagy memóriabankokhoz
Kép: Apple

Az Apple kutatói olyan nyelvimodell-architektúrát és előtanítási módszert mutattak be, amely a ritka, hosszú farokhoz tartozó tudást külön paraméteres memóriában tárolja. A megközelítés célja, hogy kisebb modellek férjenek hozzá nagy tudásbankokhoz, miközben a modell maga az általános tudásra és következtetésre összpontosít.

A lényeg röviden
  • Az Apple kutatói hierarchikus, paraméteres memóriabankokat kapcsolnának kis nyelvi modellekhez.
  • A rendszer kontextusfüggően csak egy kis memóriablokkot kér le.
  • A ritka tudás a memóriába, a közös tudás és a következtetés az alapmodellbe kerülhet.
  • Egy 160 millió paraméteres modell 18 millió paraméteres memóriával hasonlóan teljesített, mint egy több mint kétszer nagyobb hagyományos modell.
  • A hierarchikus előrecsatolt memóriákat 21 milliárd paraméternél nagyobb méretig vizsgálták.

A tudást külön memóriába szerveznék

Az Apple kutatási oldala szerint a modern nyelvi modellek teljesítménynövekedése jelenleg nagyrészt a paraméterszám növelésére épül. A nagyobb modellek több, a világról szóló tudást képesek tárolni, és jobban következtetnek. A kutatók szerint azonban nem szükséges minden ismeretet a modell paramétereibe sűríteni, mivel egy adott kérés során ezeknek csak egy része kerül felhasználásra.

Ez a megoldás különösen korlátozott, futás közbeni memóriával és számítási kapacitással rendelkező peremközeli eszközöknél lehet fontos. Az Apple kutatói memória-kiegészített architektúrát és ehhez igazított előtanítási stratégiát javasolnak. A rendszer kis nyelvi modelleket kapcsol nagy, hierarchikus paraméteres memóriabankokhoz, amelyek a világról szóló ismereteket kódolják.

Csak a szükséges memóriablokk kerül elő

A módszer lényege, hogy előtanításkor és következtetéskor a rendszer egy kis, az adott kontextustól függő memóriablokkot kér le, majd ezt hozzáadja a modellhez. Így a teljes memóriabanknak nem kell minden egyes kérésnél aktívnak lennie.

Az előtanítás során a rendszer a ritka, hosszú farokhoz tartozó világtudást a memória paramétereiben igyekszik elhelyezni. A kisebb nyelvi modell ezzel párhuzamosan horgonyként működik: a gyakori tudást, valamint az általános következtetési képességeket hordozza. A kutatás címe, Pretraining with Hierarchical Memories: Separating Long-Tail and Common Knowledge, erre a tudásmegosztásra utal.

A tanulmány szerzői Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof és Oncel Tuzel. A munka az ICLR konferenciához kapcsolódik, és az Apple kutatási oldalán a tudásbázisok és keresés, valamint a módszerek és algoritmusok területén szerepel.

A bemutatott kísérletek eredményei

Az Apple közlése szerint a kutatók ezermilliárd token léptékű kísérleteket végeztek. Ezekben egy 160 millió paraméteres modellhez 18 millió paraméteres, lekért memóriát kapcsoltak egy 4,6 milliárd paraméteres memóriabankból. A beszámoló szerint ez a rendszer hasonló teljesítményt ért el, mint egy olyan hagyományos modell, amelynek paraméterszáma több mint kétszer nagyobb.

A kutatók emellett kiterjedt kísérletekben vizsgálták, hogy a transzformerekben milyen típusú és méretű paraméteres memóriák működnek a legjobban. A memóriákat 21 milliárd paraméternél nagyobb méretig skálázták. Megállapításuk szerint az általuk javasolt hierarchikus, előrecsatolt memóriák különböző transzformer-architektúrákban is robusztusan működnek.

A forrás alapján a megoldás akkor is alkalmazható, ha a memóriát már az előtanítás során hozzáadják a rendszerhez, és akkor is, ha ezt utólag, úgynevezett post-hoc módon teszik meg.

Mit jelenthet ez a felhasználók számára?

A kutatás olyan modellfelépítést vázol, amelyben a kisebb nyelvi modellnek nem kell a teljes világtudást saját paramétereiben tárolnia. A kontextus alapján lekért memóriablokkok révén a rendszer nagyobb tudásbankhoz férhet hozzá, miközben az alapmodell mérete alacsonyabb maradhat.

Az Apple közlése nem egy kész termék vagy konkrét eszköz bejelentéséről szól, hanem egy kutatási módszert mutat be. A bemutatott eredmények alapján a hierarchikus memóriák az előtanítás és a következtetés során is használhatók, továbbá a megközelítés a korlátozott futásidejű memóriával és számítási kapacitással rendelkező eszközök szempontjából is releváns kutatási irányt jelenthet.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket
Kutatás2026. szeptember 30.

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket

Közös, szelektív tartós memóriát mutat be az Apple kutatási anyaga az ügynökalapú LLM-rendszerekhez, amelyek több lépésben, eszközhasználattal állítanak elő kódot. A…