Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Meta megduplázta GEM ajánlási modelljének tanítási hatékonyságát

2026. augusztus 3. 20:00Forrás: Engineering at Meta
A Meta megduplázta GEM ajánlási modelljének tanítási hatékonyságát
Kép: Engineering at Meta

A Meta megduplázta a Facebook és az Instagram hirdetési ajánlásait támogató GEM alapmodell végponttól végpontig mért tanítási hatékonyságát. A vállalat szerint a modell tanításához használt számítási teljesítmény egy év alatt négyszeresére nőtt, miközben a hatékonyság 20, illetve 25 százalékos MFU-ra emelkedett.

A lényeg röviden
  • A GEM a Facebook és az Instagram hirdetési ajánlásainak alapmodellje.
  • A Meta szerint a tanítás végponttól végpontig mért hatékonysága 20, illetve 25 százalékos MFU-ra nőtt.
  • A modell tanításának teljes számítási igénye 12 hónap alatt négyszeresére emelkedett.
  • A GEM több billió ritka és több milliárd sűrű paramétert tartalmaz.
  • A Meta egyedi kerneleket, MXFP8 tanítást és topológiatudatos ötdimenziós párhuzamosítást alkalmaz.

Ajánlási modell LLM-méretű infrastruktúrán

A Meta Generative Ads Recommendation Model, röviden GEM, a Facebook és az Instagram hirdetési ajánlásainak központi alapmodellje. A vállalat mérnöki blogján, 2026. augusztus 3-án közzétett beszámoló szerint a modellt már több ezer legújabb generációs GPU-n, nagy nyelvi modellekhez hasonló méretű infrastruktúrán tanítják.

A GEM hibrid felépítésű. Több billió ritka, úgynevezett sparse embedding paramétert és több milliárd sűrű paramétert tartalmaz. A tanítás reklámtartalmakon és felhasználói aktivitási adatokon zajlik. Az adatok között szekvenciális jellemzők, például a felhasználói aktivitási előzmények, valamint nem szekvenciális jellemzők, például a felhasználó helye és a hirdetés kreatív tartalmának reprezentációja szerepelnek.

Miért nehéz a GEM tanítása?

A Meta szerint a nagy nyelvi modellekhez optimalizált infrastruktúra közvetlenül nem alkalmazható a GEM-re. A hirdetési ajánlási feladatok adatai és a modell felépítése eltér a tipikus LLM-munkaterhelésektől, ezért a vállalat a GPU-magok kihasználását, a pontosságot, a párhuzamosítást, a hálózati kapcsolatokat és a memóriakezelést együtt tervezte meg.

A felhasználói aktivitási előzmények hossza mintánként erősen változik. A maximális hosszra történő kitöltés a Meta szerint akár a számítások 50 százalékát is elpazarolhatná. További nehézséget jelentenek az eltérő figyelmi minták, a memóriasávszélesség által korlátozott műveletek, valamint az, hogy az átkattintási és konverziós arány előrejelzésére épülő célok érzékenyek a numerikus változásokra. Emiatt az alacsonyabb pontosságú tanítás alkalmazása minőségromlást okozhat, ha nem megfelelően hangolják.

Több ezer GPU összekapcsolásakor a kommunikáció, a terhelés egyenetlensége, a hosszú szekvenciák miatt szükséges aktiváció-újraszámítás és az eltérő rétegszerkezetek is ronthatják a skálázást.

Egyedi GPU-kód és ötdimenziós párhuzamosítás

A Meta a helyi számítási hatékonyság javítására saját ajánlási kernelkönyvtárat és ultraalacsony pontosságú tanítási eljárást készített. A Jagged Flash Attention közvetlenül a változó hosszúságú, úgynevezett szabdalt tenzorokon dolgozik, így nincs szükség a sorozatok maximális hosszra történő kitöltésére. A megoldás egyedi figyelmi torzításokat, eltérő lekérdezési és kulcsérték-hosszakat, valamint hatékony visszafelé futást is támogat.

A BlockAttention a Meta leírása szerint a hosszú felhasználói előzmények önfigyelmének számítási költségét O(L²) helyett O(L) formára csökkenti, miközben megőrzi a modell minőségét és hatékonyságát. A Generalized Dot-Product Attention a GEM eltérő és aszimmetrikus figyelmi moduljait egységesíti. Az MXFP8 pontosságú figyelem- és MLP-műveletek pedig a vállalat szerint úgy használják ki az alacsonyabb pontosságú Tensor Core-ok teljesítményét, hogy nem rontják a pontosságérzékeny CTR- és CVR-célokat.

A több GPU-s tanításnál a Meta topológiatudatos, ötdimenziós párhuzamosítást alkalmaz. Ebben a sűrű paraméterekhez két dimenziós FSDP és szakértői párhuzamosítás, a ritka paraméterekhez pedig teljesen felosztott, két dimenziós modellpárhuzamosítás társul. A rendszert a Meta többrétegű hálózati felépítésével közösen tervezték, hogy csökkenjen a kommunikációs többlet.

Mit jelent ez a Meta rendszerei számára?

A Meta a végponttól végpontig mért MFU-t, vagyis a modell számítási kapacitásának kihasználását a helyi GPU-hatékonyság és a skálázási arány szorzataként vizsgálja. A helyi MFU azt mutatja meg, mennyire használja ki egyetlen GPU számítási egységeit, a skálázási arány pedig azt, mennyi marad meg ebből a teljesítményből több ezer GPU használatakor.

A vállalat beszámolója szerint e két terület együttes optimalizálásával a GEM végponttól végpontig mért tanítási hatékonysága 20, illetve 25 százalékos MFU-ra nőtt. Eközben a tanítás teljes számítási igénye az előző 12 hónapban négyszeresére emelkedett. A fejlesztések így a Meta hirdetési ajánlási modelljének nagyobb léptékű tanítását célozzák, olyan infrastruktúrán, amelyet a vállalat kifejezetten az ajánlási rendszerek eltérő adat- és számítási mintáihoz igazított.

Kapcsolódó hírek

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch szerint a TLX gyorsabb lett a Blackwell Jagged Flash Attentionjénél

A PyTorch csapata olyan Jagged Flash Attention kernelt mutatott be NVIDIA Blackwell B200 GPU-kra, amely a vállalat mérései szerint a GEM munkaterhelésén gyorsabb volt a…

Kutatás
Kutatás2026. október 2. 00:26

A PyTorch TLX-kernellel gyorsította a Meta hirdetési modelljének figyelmét

A PyTorch olyan Jagged Flash Attention-kernelt mutatott be, amely az NVIDIA Blackwell B200 gyorsítón a Meta Generative Ads Model modelljéhez fontos alakzatokon…

A Meta One előfizetéssel több AI-funkciót és üzleti eszközt kínál
Termékek és eszközök2026. szeptember 15. 17:25

A Meta One előfizetéssel több AI-funkciót és üzleti eszközt kínál

A Meta új, Meta One nevű előfizetéses szolgáltatást indított, amely több AI-használatot, kiterjesztett önkifejezési lehetőségeket és üzleti eszközöket kínál. Az…