Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

NVIDIA: generatív ajánlórendszerek válthatják le a hagyományos RecSys-modelleket

2026. augusztus 20. 18:00Forrás: NVIDIA Developer
NVIDIA: generatív ajánlórendszerek válthatják le a hagyományos RecSys-modelleket
Kép: NVIDIA Developer

Az NVIDIA Developer 2026. augusztus 20-án közzétett bejegyzése szerint a generatív ajánlórendszerek a felhasználói előzmények alapján következő elemet vagy műveletet jósolnak. A cég a recsys-examples és az nv-embedding-cache eszközökkel mutatja be, hogyan lehet ezeket nagy léptékben tanítani és kiszolgálni.

A lényeg röviden
  • Az NVIDIA szerint a generatív ajánlók a következő elem vagy művelet előrejelzésére alakítják át az ajánlást.
  • A recsys-examples HSTU és Semantic ID modellek tanítási és következtetési implementációit tartalmazza PyTorch-hoz.
  • A DynamicEmb igény szerint oszt ki beágyazási sorokat HBM és host memória között.
  • HSTU következtetésnél az NVIDIA legfeljebb 2,38-szoros gyorsulást közöl a Python backendhez képest.
  • Semantic ID modelleknél H100 GPU-kon 2,14-szeres és 2,27-szeres közötti alacsonyabb offline késleltetést írnak le az SGLang beam search-hoz képest.

Miért nehéz nagy léptékben ajánlórendszert futtatni?

Az NVIDIA bejegyzése szerint az ajánlórendszerek a fogyasztói internet egyik legelterjedtebb gépi tanulási feladatai közé tartoznak, de nagy léptékben különösen nehéz a tanításuk és az éles kiszolgálásuk. A fő adattípus a felhasználói előzmény, vagyis annak nyoma, hogy a felhasználók hogyan lépnek interakcióba egy katalógus elemeivel.

A vállalat szerint ezek az adatok gyakran kategorikus és folytonos jellemzők keverékéből állnak, és időben gyorsan változnak. Ipari méretben az adat mennyisége naponta terabájtos vagy petabájtos nagyságrendű lehet, ami még a csúcskategóriás gyorsítók GPU-memóriájába, a HBM-be sem fér be teljes egészében.

A forrás három további problémát emel ki. Az egyik a hosszú farok jelenség, amikor kevés népszerű elem kapja az interakciók többségét, miközben a ritkább elemekről kevés tanulási jel áll rendelkezésre. A másik a cold start, amikor új felhasználóknál vagy új elemeknél nincs elegendő interakciós előzmény. A harmadik az alacsony késleltetés követelménye: az ajánlórendszereknek gyakran több ezer jelölt elemet kell lekérniük és rangsorolniuk néhány ezredmásodperc alatt, szigorú szolgáltatási szintű megállapodások mellett.

A generatív ajánlók szekvenciamodellezésként kezelik az ajánlást

A generatív ajánlórendszerek az NVIDIA leírása szerint a hagyományos, beágyazások hasonlóságára építő megközelítés helyett szekvenciamodellezési feladatként fogalmazzák meg az ajánlást. A cél annak valószínűségi modellezése, hogy egy felhasználói előzménysor alapján mi lesz a következő elem vagy művelet.

A bejegyzés szerint ez a váltás homogénebb, Transformer-szerű architektúrák felé viszi a területet. Az NVIDIA úgy fogalmaz, hogy ez jobban kihasználhatja a skálázási törvényeket, egy modellben egyesítheti a lekérést és a rangsorolást, valamint természetesebben kapcsolódhat a gyorsan fejlődő LLM-ökoszisztémához.

A forrás két elterjedt megközelítést nevez meg: a Hierarchical Sequential Transduction Units, röviden HSTU, valamint a Semantic IDs módszert. A HSTU-t a bejegyzés szerint a Meta mutatta be 2024-ben. A modell az adatot felhasználónkénti, időrendbe rendezett sorozatként kezeli, amelyben elemek és műveletek, például kedvelések vagy kattintások váltják egymást. A HSTU a forrás szerint csökkenti a kézi jellemzőtervezéstől való függést, és a felhasználó, elem interakciók feletti figyelmi mechanizmusból tanul sorozatreprezentációkat.

A Semantic IDs megközelítésnél a cél a nagy elemkorpusz problémáinak enyhítése. Az NVIDIA szerint a módszer az elemek beágyazásainak hierarchikus klaszterezésével kisebb új szókészletet hoz létre. A bejegyzés példaként a TIGER, PLUM, OneRec v1/v2 és több modern generatív ajánlóarchitektúrát említ, amelyek Semantic IDs alapokra építenek.

Mit ad a recsys-examples és a DynamicEmb?

Az NVIDIA recsys-examples tárháza PyTorch-alapú példákat ad generatív ajánlók tanításához és telepítéséhez NVIDIA GPU-kon. A forrás szerint optimalizált HSTU és Semantic ID implementációkat tartalmaz, tanítási és következtetési munkafolyamatokkal együtt.

A tárház három moduláris összetevőt is összefog: a DynamicEmb beágyazási rétegeket, egy ajánlórendszerekhez igazított KV cache és tároláskezelőt, valamint hatékony CUDA műveleteket HSTU és Semantic ID beam search dekódoláshoz.

A DynamicEmb szerepe a statikus beágyazási táblák kiváltása. Az NVIDIA szerint a hagyományos RecSys-beágyazási táblák rögzített szókészlettel számolnak, miközben éles rendszerekben folyamatosan jelennek meg új felhasználók és elemek. A túlméretezés memóriát pazarol olyan sorokra, amelyeket a modell soha nem érint, az alulméretezés pedig drága másolásokat okozhat.

A DynamicEmb ezzel szemben GPU-ra optimalizált, pontozott hash táblát használ, amely tetszőleges jellemzőazonosítókat rendel beágyazási sorokhoz igény szerint. A sorok csak azokhoz az azonosítókhoz jönnek létre, amelyeket a modell ténylegesen lát, a tábla pedig HBM és rögzített host memória között él, így egyetlen GPU kapacitásán túl is nőhet. A bejegyzés szerint a beléptetésvezérlés és a pontszám alapú kilakoltatás segít abban, hogy a kapacitás a tanítás szempontjából fontos azonosítókra menjen.

Gyorsítási eredmények HSTU és Semantic ID modelleknél

Az NVIDIA a következtetésnél több gyorsítási adatot is megad. HSTU esetén a recsys-examples támogatja a PyTorch AOTInductort Triton Inference Serverrel. A bejegyzés szerint az nv-embedding-cache és a FlexKV-kompatibilis KV cache kombinációja teljes GPU-s cache-találati forgatókönyvben legfeljebb 2,38-szoros gyorsulást ad a Python backendhez képest.

A Semantic ID modellekhez a forrás egy generatív ajánlókra specializált következtetési keretrendszert ír le. Ez szétválasztja a megosztott kontextus KV-t, az egyes beam ágak dekódolási KV-jét és a beam leszármazási információit. Az NVIDIA szerint ez H100 GPU-kon 2,14-szeres és 2,27-szeres közötti alacsonyabb offline késleltetést, valamint 1,85-szörös online áteresztőképességet ér el az SGLang beam search megoldásához képest.

Az nv-embedding-cache a forrás szerint nagy léptékű beágyazáslekérdezéseket gyorsít hierarchikus gyorsítótárral: GPU cache, CPU cache és távoli paramétertár együttműködésével. A megoldás zárolásmentes érvénytelenítést használ, és PyTorch-integrációhoz drop-in NVEmbedding és NVEmbeddingBag modulokat kínál.

Mit jelent ez a felhasználóknak és a piacnak?

A bejegyzés alapján a generatív ajánlók legfontosabb ígérete, hogy a lekérést és a rangsorolást egységesebb modellben kezelhetik, miközben jobban illeszkednek az LLM-eknél elterjedt architektúrákhoz. Ez a fejlesztőknek azért lényeges, mert a RecSys rendszerekben egyszerre kell kezelni a hatalmas, gyorsan változó katalógusokat, a ritka interakciókat és a szigorú késleltetési korlátokat.

Az NVIDIA által bemutatott eszközök nem kész fogyasztói termékként jelennek meg a forrásban, hanem fejlesztői és infrastruktúra elemekként. A recsys-examples gyorsindító útmutatója a generatív ajánlók tanításának és telepítésének kipróbálására szolgál, az nv-embedding-cache áttekintése pedig a hierarchikus gyorsítótárazási architektúrát és a PyTorch-integrációt mutatja be.

Kapcsolódó hírek

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix NVIDIA és Together AI együttműködésével gyorsítja az AI-inferenciát

Az Equinix, a NVIDIA és a Together AI közös megoldással gyorsítaná az AI-inferencia kísérleti fázisból éles környezetbe való átvezetését. Az Equinix Inference Exchange…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix, az NVIDIA és a Together AI az AI-következtetést célozza

Az Equinix, az NVIDIA és a Together AI közös platformmal gyorsítaná a vállalati mesterségesintelligencia-modellek éles környezetbe állítását. Az Equinix Inference…

NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel
Fejlesztőknek2026. szeptember 30. 22:54

NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel

Az NVIDIA új, végponttól végpontig használható HSTU inferenciafolyamatot mutatott be generatív ajánlórendszerekhez a recsys-examples tárolóban. A megoldás Dynamo-Triton…