NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel

Az NVIDIA új, végponttól végpontig használható HSTU inferenciafolyamatot mutatott be generatív ajánlórendszerekhez a recsys-examples tárolóban. A megoldás Dynamo-Triton, PyTorch AOTI és FlexKV-alapú KV cache segítségével csökkenti a hosszú felhasználói előzmények ismételt feldolgozását.
- Az NVIDIA HSTU generatív ajánló inferenciafolyamatot mutatott be a recsys-examples tárolóban.
- A munkafolyamat Dynamo-Triton, PyTorch AOTI, FlexKV, NV Embedding Cache és natív C++ validáció elemeket használ.
- A KV cache célja a hosszú felhasználói előzmények ismételt feldolgozásának csökkentése.
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-n a nyolcrétegű HSTU modellnél akár 5,93-szoros gyorsulást mértek 100 százalékos GPU KV-cache találati aránynál.
Generatív ajánlás szekvenciamodellezéssel
Az NVIDIA Developer blogján 2026. szeptember 30-án megjelent bejegyzés szerint a generatív ajánlórendszerek a személyre szabást szekvenciamodellezési feladatként kezelik. A felhasználói interakciók, a kontextus, a jelölt elemek és a műveletek nagy kardinalitású eseményfolyam tokenjeivé válnak, a modell pedig ebből tanulja meg a következő releváns elemek pontozását vagy előállítását.
Az NVIDIA szerint ez a megközelítés különösen olyan ajánlási terheléseknél lehet hasznos, ahol hosszúak a felhasználói előzmények, folyamatosan változnak az elemkatalógusok, és a személyre szabás minősége a gazdag szekvenciális viselkedés modellezésétől függ. A kihívás az, hogy az ilyen modelleknek alacsony késleltetésű inferenciát kell nyújtaniuk hosszú előzmények, nagy beágyazási táblák és szekvenciaigényes architektúrák mellett.
A most bemutatott folyamat a Hierarchical Sequential Transduction Unit, vagyis HSTU generatív ajánló inferenciáját támogatja az NVIDIA recsys-examples tárolón keresztül. A megoldás HSTU modelleket, PyTorch Ahead-of-Time Inductor fordítást, FlexKV-alapú KV cache-t, natív C++ validációt, NV Embedding Cache-t és Dynamo-Triton üzembe helyezést kapcsol össze.
Miért fontos a KV cache a HSTU kiszolgálásában?
A forrás szerint a HSTU-kat olyan generatív ajánlási terhelésekhez vezették be, amelyek nagy kardinalitású, nem stacionárius eseményfolyamokon működnek. Az NVIDIA példájában a modell bemenete kategorikus tokenekből épül fel: a kontextuális tokenek felhasználói információkat, az elemtokenek elemeket, az opcionális művelettokenek pedig felhasználói interakciókat jelölnek.
A HSTU előfeldolgozási útvonala beágyazásokat kér le, művelettokenek jelenlétében összefűzi az elem és művelet beágyazásait, hozzáadja a kontextuális információkat, majd pozíciókódolást alkalmaz. Ezután a HSTU blokkok feldolgozzák a szekvenciát, a predikciós fej pedig többfeladatos rangsorolási kimeneteket állít elő.
A kiszolgálási gondot az okozza, hogy a hosszú történeti szekvenciák teljes key-value állapotának újraszámítása minden kérésnél felesleges munkát és nagyobb késleltetést eredményezhet. A KV cache újrahasználható key-value adatokat tárol korábbi szekvenciaszámításokból, így a modell elkerülheti a felhasználói előzmények gyorsítótárazott részeinek ismételt feldolgozását.
Az NVIDIA HSTU inferenciafolyamatában a KVCacheManager GPU memóriát és gazdagépoldali tárolót használ a KV adatok cache-elésére. A GPU cache lapozott KV adattáblaként szerveződik, és támogatja a keresést, allokációt, hozzáfűzést és kiürítést. Ha a GPU cache helye szűkös, a régebbi felhasználók LRU-szerű szabály szerint kikerülhetnek a cache-ből.
PyTorch AOTI és Dynamo-Triton a telepítési láncban
A PyTorch AOTI, teljes nevén Ahead-of-Time Inductor, a PyTorch modellből indul ki, majd a torch.export és a PyTorch AOTI segítségével exportálja azt. Az AOTI előre lefordítja a modellt egy olyan csomagba, amelyet natív C++ futtatókörnyezet is be tud tölteni. Az NVIDIA szerint ez csökkenti a Python futtatási többletterhét, és üzembe helyezésre alkalmas artefaktumot ad a Dynamo-Triton PyTorch AOTI backendjéhez.
Az exportált modellcsomag az AOTI modellarchívum mellett metaadatokat és beágyazási táblaállományokat is tartalmaz. A példában a beágyazási megvalósítás DynamicEmb inferencia beágyazási táblákat és NV Embedding Cache-t kombinál. Az NV Embedding Cache azzal csökkenti a GPU memóriaigényt, hogy csak a népszerű beágyazásokat tartja GPU memóriában, miközben a teljes tábla CPU memóriában marad.
A munkafolyamat több módon validálja ugyanazokat az exportált artefaktumokat. Python export szkriptek generálják a csomagot és a visszajátszási tenzorokat, natív C++ futtatható állományok pedig betöltik és visszajátsszák az exportált modellt helyességi és teljesítményellenőrzéshez. Ezután a Dynamo-Triton üzembe helyezés ugyanazt az AOTI csomagot és visszajátszási útvonalat használja.
A teljes folyamat öt szakaszból áll: az egyedi operátorok és futtatókönyvtárak felépítése, a HSTU rangsoroló modell exportálása PyTorch AOTI-val, a FlexKV-alapú KV-cache szolgáltatás elindítása, az exportált artefaktumok validálása natív C++ visszajátszással, majd az exportált KV-cache AOTI modell kiszolgálása Dynamo-Tritonnal.
Akár 5,93-szoros késleltetéscsökkenés a mérésben
Az NVIDIA mérése szerint dinamikus 8-as batch méretnél, NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-n a Dynamo-Triton PyTorch AOTI-val legjobb esetben akár 4,47-szeres gyorsulást ért el a háromrétegű HSTU modellnél, és 5,93-szorosat a nyolcrétegű modellnél, 100 százalékos GPU KV-cache találati arány mellett. Az összehasonlítás alapja ugyanaz az AOTI konfiguráció volt KV cache nélkül.
A forrás úgy fogalmaz, hogy a bemutatott útvonal célja a HSTU generatív ajánló átvitele PyTorch fejlesztési környezetből éles inferenciába Dynamo-Triton, PyTorch AOTI és FlexKV használatával, anélkül, hogy a modellt külön futtatókörnyezetre kellene átírni.
A felhasználói és piaci jelentőség abból következik, hogy a modern ajánlórendszereknek hosszú előzményeket és változó katalógusokat kell kezelniük alacsony késleltetéssel. Az NVIDIA megközelítése a forrás alapján a kiszolgálási lánc több pontján kezeli ezt: az AOTI a lefordított modellartefaktumot adja, a FlexKV a hosszú előzmények újraszámítását csökkenti, az NV Embedding Cache pedig a GPU memóriaigény mérséklését célozza.
NVIDIA Developer: Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton


