A Meta megduplázta GEM ajánlási modelljének tanítási hatékonyságát

A Meta megduplázta a Facebook és az Instagram hirdetési ajánlásait támogató GEM alapmodell végponttól végpontig mért tanítási hatékonyságát. A vállalat szerint a modell tanításához használt számítási teljesítmény egy év alatt négyszeresére nőtt, miközben a hatékonyság 20, illetve 25 százalékos MFU-ra emelkedett.
- A GEM a Facebook és az Instagram hirdetési ajánlásainak alapmodellje.
- A Meta szerint a tanítás végponttól végpontig mért hatékonysága 20, illetve 25 százalékos MFU-ra nőtt.
- A modell tanításának teljes számítási igénye 12 hónap alatt négyszeresére emelkedett.
- A GEM több billió ritka és több milliárd sűrű paramétert tartalmaz.
- A Meta egyedi kerneleket, MXFP8 tanítást és topológiatudatos ötdimenziós párhuzamosítást alkalmaz.
Ajánlási modell LLM-méretű infrastruktúrán
A Meta Generative Ads Recommendation Model, röviden GEM, a Facebook és az Instagram hirdetési ajánlásainak központi alapmodellje. A vállalat mérnöki blogján, 2026. augusztus 3-án közzétett beszámoló szerint a modellt már több ezer legújabb generációs GPU-n, nagy nyelvi modellekhez hasonló méretű infrastruktúrán tanítják.
A GEM hibrid felépítésű. Több billió ritka, úgynevezett sparse embedding paramétert és több milliárd sűrű paramétert tartalmaz. A tanítás reklámtartalmakon és felhasználói aktivitási adatokon zajlik. Az adatok között szekvenciális jellemzők, például a felhasználói aktivitási előzmények, valamint nem szekvenciális jellemzők, például a felhasználó helye és a hirdetés kreatív tartalmának reprezentációja szerepelnek.
Miért nehéz a GEM tanítása?
A Meta szerint a nagy nyelvi modellekhez optimalizált infrastruktúra közvetlenül nem alkalmazható a GEM-re. A hirdetési ajánlási feladatok adatai és a modell felépítése eltér a tipikus LLM-munkaterhelésektől, ezért a vállalat a GPU-magok kihasználását, a pontosságot, a párhuzamosítást, a hálózati kapcsolatokat és a memóriakezelést együtt tervezte meg.
A felhasználói aktivitási előzmények hossza mintánként erősen változik. A maximális hosszra történő kitöltés a Meta szerint akár a számítások 50 százalékát is elpazarolhatná. További nehézséget jelentenek az eltérő figyelmi minták, a memóriasávszélesség által korlátozott műveletek, valamint az, hogy az átkattintási és konverziós arány előrejelzésére épülő célok érzékenyek a numerikus változásokra. Emiatt az alacsonyabb pontosságú tanítás alkalmazása minőségromlást okozhat, ha nem megfelelően hangolják.
Több ezer GPU összekapcsolásakor a kommunikáció, a terhelés egyenetlensége, a hosszú szekvenciák miatt szükséges aktiváció-újraszámítás és az eltérő rétegszerkezetek is ronthatják a skálázást.
Egyedi GPU-kód és ötdimenziós párhuzamosítás
A Meta a helyi számítási hatékonyság javítására saját ajánlási kernelkönyvtárat és ultraalacsony pontosságú tanítási eljárást készített. A Jagged Flash Attention közvetlenül a változó hosszúságú, úgynevezett szabdalt tenzorokon dolgozik, így nincs szükség a sorozatok maximális hosszra történő kitöltésére. A megoldás egyedi figyelmi torzításokat, eltérő lekérdezési és kulcsérték-hosszakat, valamint hatékony visszafelé futást is támogat.
A BlockAttention a Meta leírása szerint a hosszú felhasználói előzmények önfigyelmének számítási költségét O(L²) helyett O(L) formára csökkenti, miközben megőrzi a modell minőségét és hatékonyságát. A Generalized Dot-Product Attention a GEM eltérő és aszimmetrikus figyelmi moduljait egységesíti. Az MXFP8 pontosságú figyelem- és MLP-műveletek pedig a vállalat szerint úgy használják ki az alacsonyabb pontosságú Tensor Core-ok teljesítményét, hogy nem rontják a pontosságérzékeny CTR- és CVR-célokat.
A több GPU-s tanításnál a Meta topológiatudatos, ötdimenziós párhuzamosítást alkalmaz. Ebben a sűrű paraméterekhez két dimenziós FSDP és szakértői párhuzamosítás, a ritka paraméterekhez pedig teljesen felosztott, két dimenziós modellpárhuzamosítás társul. A rendszert a Meta többrétegű hálózati felépítésével közösen tervezték, hogy csökkenjen a kommunikációs többlet.
Mit jelent ez a Meta rendszerei számára?
A Meta a végponttól végpontig mért MFU-t, vagyis a modell számítási kapacitásának kihasználását a helyi GPU-hatékonyság és a skálázási arány szorzataként vizsgálja. A helyi MFU azt mutatja meg, mennyire használja ki egyetlen GPU számítási egységeit, a skálázási arány pedig azt, mennyi marad meg ebből a teljesítményből több ezer GPU használatakor.
A vállalat beszámolója szerint e két terület együttes optimalizálásával a GEM végponttól végpontig mért tanítási hatékonysága 20, illetve 25 százalékos MFU-ra nőtt. Eközben a tanítás teljes számítási igénye az előző 12 hónapban négyszeresére emelkedett. A fejlesztések így a Meta hirdetési ajánlási modelljének nagyobb léptékű tanítását célozzák, olyan infrastruktúrán, amelyet a vállalat kifejezetten az ajánlási rendszerek eltérő adat- és számítási mintáihoz igazított.
Engineering at Meta: GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
