NVIDIA: generatív ajánlórendszerek válthatják le a hagyományos RecSys-modelleket

Az NVIDIA Developer 2026. augusztus 20-án közzétett bejegyzése szerint a generatív ajánlórendszerek a felhasználói előzmények alapján következő elemet vagy műveletet jósolnak. A cég a recsys-examples és az nv-embedding-cache eszközökkel mutatja be, hogyan lehet ezeket nagy léptékben tanítani és kiszolgálni.
- Az NVIDIA szerint a generatív ajánlók a következő elem vagy művelet előrejelzésére alakítják át az ajánlást.
- A recsys-examples HSTU és Semantic ID modellek tanítási és következtetési implementációit tartalmazza PyTorch-hoz.
- A DynamicEmb igény szerint oszt ki beágyazási sorokat HBM és host memória között.
- HSTU következtetésnél az NVIDIA legfeljebb 2,38-szoros gyorsulást közöl a Python backendhez képest.
- Semantic ID modelleknél H100 GPU-kon 2,14-szeres és 2,27-szeres közötti alacsonyabb offline késleltetést írnak le az SGLang beam search-hoz képest.
Miért nehéz nagy léptékben ajánlórendszert futtatni?
Az NVIDIA bejegyzése szerint az ajánlórendszerek a fogyasztói internet egyik legelterjedtebb gépi tanulási feladatai közé tartoznak, de nagy léptékben különösen nehéz a tanításuk és az éles kiszolgálásuk. A fő adattípus a felhasználói előzmény, vagyis annak nyoma, hogy a felhasználók hogyan lépnek interakcióba egy katalógus elemeivel.
A vállalat szerint ezek az adatok gyakran kategorikus és folytonos jellemzők keverékéből állnak, és időben gyorsan változnak. Ipari méretben az adat mennyisége naponta terabájtos vagy petabájtos nagyságrendű lehet, ami még a csúcskategóriás gyorsítók GPU-memóriájába, a HBM-be sem fér be teljes egészében.
A forrás három további problémát emel ki. Az egyik a hosszú farok jelenség, amikor kevés népszerű elem kapja az interakciók többségét, miközben a ritkább elemekről kevés tanulási jel áll rendelkezésre. A másik a cold start, amikor új felhasználóknál vagy új elemeknél nincs elegendő interakciós előzmény. A harmadik az alacsony késleltetés követelménye: az ajánlórendszereknek gyakran több ezer jelölt elemet kell lekérniük és rangsorolniuk néhány ezredmásodperc alatt, szigorú szolgáltatási szintű megállapodások mellett.
A generatív ajánlók szekvenciamodellezésként kezelik az ajánlást
A generatív ajánlórendszerek az NVIDIA leírása szerint a hagyományos, beágyazások hasonlóságára építő megközelítés helyett szekvenciamodellezési feladatként fogalmazzák meg az ajánlást. A cél annak valószínűségi modellezése, hogy egy felhasználói előzménysor alapján mi lesz a következő elem vagy művelet.
A bejegyzés szerint ez a váltás homogénebb, Transformer-szerű architektúrák felé viszi a területet. Az NVIDIA úgy fogalmaz, hogy ez jobban kihasználhatja a skálázási törvényeket, egy modellben egyesítheti a lekérést és a rangsorolást, valamint természetesebben kapcsolódhat a gyorsan fejlődő LLM-ökoszisztémához.
A forrás két elterjedt megközelítést nevez meg: a Hierarchical Sequential Transduction Units, röviden HSTU, valamint a Semantic IDs módszert. A HSTU-t a bejegyzés szerint a Meta mutatta be 2024-ben. A modell az adatot felhasználónkénti, időrendbe rendezett sorozatként kezeli, amelyben elemek és műveletek, például kedvelések vagy kattintások váltják egymást. A HSTU a forrás szerint csökkenti a kézi jellemzőtervezéstől való függést, és a felhasználó, elem interakciók feletti figyelmi mechanizmusból tanul sorozatreprezentációkat.
A Semantic IDs megközelítésnél a cél a nagy elemkorpusz problémáinak enyhítése. Az NVIDIA szerint a módszer az elemek beágyazásainak hierarchikus klaszterezésével kisebb új szókészletet hoz létre. A bejegyzés példaként a TIGER, PLUM, OneRec v1/v2 és több modern generatív ajánlóarchitektúrát említ, amelyek Semantic IDs alapokra építenek.
Mit ad a recsys-examples és a DynamicEmb?
Az NVIDIA recsys-examples tárháza PyTorch-alapú példákat ad generatív ajánlók tanításához és telepítéséhez NVIDIA GPU-kon. A forrás szerint optimalizált HSTU és Semantic ID implementációkat tartalmaz, tanítási és következtetési munkafolyamatokkal együtt.
A tárház három moduláris összetevőt is összefog: a DynamicEmb beágyazási rétegeket, egy ajánlórendszerekhez igazított KV cache és tároláskezelőt, valamint hatékony CUDA műveleteket HSTU és Semantic ID beam search dekódoláshoz.
A DynamicEmb szerepe a statikus beágyazási táblák kiváltása. Az NVIDIA szerint a hagyományos RecSys-beágyazási táblák rögzített szókészlettel számolnak, miközben éles rendszerekben folyamatosan jelennek meg új felhasználók és elemek. A túlméretezés memóriát pazarol olyan sorokra, amelyeket a modell soha nem érint, az alulméretezés pedig drága másolásokat okozhat.
A DynamicEmb ezzel szemben GPU-ra optimalizált, pontozott hash táblát használ, amely tetszőleges jellemzőazonosítókat rendel beágyazási sorokhoz igény szerint. A sorok csak azokhoz az azonosítókhoz jönnek létre, amelyeket a modell ténylegesen lát, a tábla pedig HBM és rögzített host memória között él, így egyetlen GPU kapacitásán túl is nőhet. A bejegyzés szerint a beléptetésvezérlés és a pontszám alapú kilakoltatás segít abban, hogy a kapacitás a tanítás szempontjából fontos azonosítókra menjen.
Gyorsítási eredmények HSTU és Semantic ID modelleknél
Az NVIDIA a következtetésnél több gyorsítási adatot is megad. HSTU esetén a recsys-examples támogatja a PyTorch AOTInductort Triton Inference Serverrel. A bejegyzés szerint az nv-embedding-cache és a FlexKV-kompatibilis KV cache kombinációja teljes GPU-s cache-találati forgatókönyvben legfeljebb 2,38-szoros gyorsulást ad a Python backendhez képest.
A Semantic ID modellekhez a forrás egy generatív ajánlókra specializált következtetési keretrendszert ír le. Ez szétválasztja a megosztott kontextus KV-t, az egyes beam ágak dekódolási KV-jét és a beam leszármazási információit. Az NVIDIA szerint ez H100 GPU-kon 2,14-szeres és 2,27-szeres közötti alacsonyabb offline késleltetést, valamint 1,85-szörös online áteresztőképességet ér el az SGLang beam search megoldásához képest.
Az nv-embedding-cache a forrás szerint nagy léptékű beágyazáslekérdezéseket gyorsít hierarchikus gyorsítótárral: GPU cache, CPU cache és távoli paramétertár együttműködésével. A megoldás zárolásmentes érvénytelenítést használ, és PyTorch-integrációhoz drop-in NVEmbedding és NVEmbeddingBag modulokat kínál.
Mit jelent ez a felhasználóknak és a piacnak?
A bejegyzés alapján a generatív ajánlók legfontosabb ígérete, hogy a lekérést és a rangsorolást egységesebb modellben kezelhetik, miközben jobban illeszkednek az LLM-eknél elterjedt architektúrákhoz. Ez a fejlesztőknek azért lényeges, mert a RecSys rendszerekben egyszerre kell kezelni a hatalmas, gyorsan változó katalógusokat, a ritka interakciókat és a szigorú késleltetési korlátokat.
Az NVIDIA által bemutatott eszközök nem kész fogyasztói termékként jelennek meg a forrásban, hanem fejlesztői és infrastruktúra elemekként. A recsys-examples gyorsindító útmutatója a generatív ajánlók tanításának és telepítésének kipróbálására szolgál, az nv-embedding-cache áttekintése pedig a hierarchikus gyorsítótárazási architektúrát és a PyTorch-integrációt mutatja be.
NVIDIA Developer: How Generative Recommenders Are Redefining RecSys at Scale
