Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel

2026. szeptember 30.Forrás: NVIDIA Developer
NVIDIA: akár 5,93-szor kisebb késleltetés HSTU ajánlóknál KV cache-sel
Kép: NVIDIA Developer

Az NVIDIA új, végponttól végpontig használható HSTU inferenciafolyamatot mutatott be generatív ajánlórendszerekhez a recsys-examples tárolóban. A megoldás Dynamo-Triton, PyTorch AOTI és FlexKV-alapú KV cache segítségével csökkenti a hosszú felhasználói előzmények ismételt feldolgozását.

A lényeg röviden
  • Az NVIDIA HSTU generatív ajánló inferenciafolyamatot mutatott be a recsys-examples tárolóban.
  • A munkafolyamat Dynamo-Triton, PyTorch AOTI, FlexKV, NV Embedding Cache és natív C++ validáció elemeket használ.
  • A KV cache célja a hosszú felhasználói előzmények ismételt feldolgozásának csökkentése.
  • NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-n a nyolcrétegű HSTU modellnél akár 5,93-szoros gyorsulást mértek 100 százalékos GPU KV-cache találati aránynál.

Generatív ajánlás szekvenciamodellezéssel

Az NVIDIA Developer blogján 2026. szeptember 30-án megjelent bejegyzés szerint a generatív ajánlórendszerek a személyre szabást szekvenciamodellezési feladatként kezelik. A felhasználói interakciók, a kontextus, a jelölt elemek és a műveletek nagy kardinalitású eseményfolyam tokenjeivé válnak, a modell pedig ebből tanulja meg a következő releváns elemek pontozását vagy előállítását.

Az NVIDIA szerint ez a megközelítés különösen olyan ajánlási terheléseknél lehet hasznos, ahol hosszúak a felhasználói előzmények, folyamatosan változnak az elemkatalógusok, és a személyre szabás minősége a gazdag szekvenciális viselkedés modellezésétől függ. A kihívás az, hogy az ilyen modelleknek alacsony késleltetésű inferenciát kell nyújtaniuk hosszú előzmények, nagy beágyazási táblák és szekvenciaigényes architektúrák mellett.

A most bemutatott folyamat a Hierarchical Sequential Transduction Unit, vagyis HSTU generatív ajánló inferenciáját támogatja az NVIDIA recsys-examples tárolón keresztül. A megoldás HSTU modelleket, PyTorch Ahead-of-Time Inductor fordítást, FlexKV-alapú KV cache-t, natív C++ validációt, NV Embedding Cache-t és Dynamo-Triton üzembe helyezést kapcsol össze.

Miért fontos a KV cache a HSTU kiszolgálásában?

A forrás szerint a HSTU-kat olyan generatív ajánlási terhelésekhez vezették be, amelyek nagy kardinalitású, nem stacionárius eseményfolyamokon működnek. Az NVIDIA példájában a modell bemenete kategorikus tokenekből épül fel: a kontextuális tokenek felhasználói információkat, az elemtokenek elemeket, az opcionális művelettokenek pedig felhasználói interakciókat jelölnek.

A HSTU előfeldolgozási útvonala beágyazásokat kér le, művelettokenek jelenlétében összefűzi az elem és művelet beágyazásait, hozzáadja a kontextuális információkat, majd pozíciókódolást alkalmaz. Ezután a HSTU blokkok feldolgozzák a szekvenciát, a predikciós fej pedig többfeladatos rangsorolási kimeneteket állít elő.

A kiszolgálási gondot az okozza, hogy a hosszú történeti szekvenciák teljes key-value állapotának újraszámítása minden kérésnél felesleges munkát és nagyobb késleltetést eredményezhet. A KV cache újrahasználható key-value adatokat tárol korábbi szekvenciaszámításokból, így a modell elkerülheti a felhasználói előzmények gyorsítótárazott részeinek ismételt feldolgozását.

Az NVIDIA HSTU inferenciafolyamatában a KVCacheManager GPU memóriát és gazdagépoldali tárolót használ a KV adatok cache-elésére. A GPU cache lapozott KV adattáblaként szerveződik, és támogatja a keresést, allokációt, hozzáfűzést és kiürítést. Ha a GPU cache helye szűkös, a régebbi felhasználók LRU-szerű szabály szerint kikerülhetnek a cache-ből.

PyTorch AOTI és Dynamo-Triton a telepítési láncban

A PyTorch AOTI, teljes nevén Ahead-of-Time Inductor, a PyTorch modellből indul ki, majd a torch.export és a PyTorch AOTI segítségével exportálja azt. Az AOTI előre lefordítja a modellt egy olyan csomagba, amelyet natív C++ futtatókörnyezet is be tud tölteni. Az NVIDIA szerint ez csökkenti a Python futtatási többletterhét, és üzembe helyezésre alkalmas artefaktumot ad a Dynamo-Triton PyTorch AOTI backendjéhez.

Az exportált modellcsomag az AOTI modellarchívum mellett metaadatokat és beágyazási táblaállományokat is tartalmaz. A példában a beágyazási megvalósítás DynamicEmb inferencia beágyazási táblákat és NV Embedding Cache-t kombinál. Az NV Embedding Cache azzal csökkenti a GPU memóriaigényt, hogy csak a népszerű beágyazásokat tartja GPU memóriában, miközben a teljes tábla CPU memóriában marad.

A munkafolyamat több módon validálja ugyanazokat az exportált artefaktumokat. Python export szkriptek generálják a csomagot és a visszajátszási tenzorokat, natív C++ futtatható állományok pedig betöltik és visszajátsszák az exportált modellt helyességi és teljesítményellenőrzéshez. Ezután a Dynamo-Triton üzembe helyezés ugyanazt az AOTI csomagot és visszajátszási útvonalat használja.

A teljes folyamat öt szakaszból áll: az egyedi operátorok és futtatókönyvtárak felépítése, a HSTU rangsoroló modell exportálása PyTorch AOTI-val, a FlexKV-alapú KV-cache szolgáltatás elindítása, az exportált artefaktumok validálása natív C++ visszajátszással, majd az exportált KV-cache AOTI modell kiszolgálása Dynamo-Tritonnal.

Akár 5,93-szoros késleltetéscsökkenés a mérésben

Az NVIDIA mérése szerint dinamikus 8-as batch méretnél, NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU-n a Dynamo-Triton PyTorch AOTI-val legjobb esetben akár 4,47-szeres gyorsulást ért el a háromrétegű HSTU modellnél, és 5,93-szorosat a nyolcrétegű modellnél, 100 százalékos GPU KV-cache találati arány mellett. Az összehasonlítás alapja ugyanaz az AOTI konfiguráció volt KV cache nélkül.

A forrás úgy fogalmaz, hogy a bemutatott útvonal célja a HSTU generatív ajánló átvitele PyTorch fejlesztési környezetből éles inferenciába Dynamo-Triton, PyTorch AOTI és FlexKV használatával, anélkül, hogy a modellt külön futtatókörnyezetre kellene átírni.

A felhasználói és piaci jelentőség abból következik, hogy a modern ajánlórendszereknek hosszú előzményeket és változó katalógusokat kell kezelniük alacsony késleltetéssel. Az NVIDIA megközelítése a forrás alapján a kiszolgálási lánc több pontján kezeli ezt: az AOTI a lefordított modellartefaktumot adja, a FlexKV a hosszú előzmények újraszámítását csökkenti, az NV Embedding Cache pedig a GPU memóriaigény mérséklését célozza.

Kapcsolódó hírek

AI-infrastruktúrát épít az SK Telecom és az NVIDIA Koreában
Cégek és üzlet2026. szeptember 28.

AI-infrastruktúrát épít az SK Telecom és az NVIDIA Koreában

Az SK Telecom és az NVIDIA AI-infrastruktúra kiépítésén dolgozik Korea AI-innovációjának támogatására az NVIDIA közlése szerint. A forrás kevés részletet közöl, de a cím…

NVIDIA NVCRE: GPU-klaszterek tesztelése éles AI-terhelés előtt
Chipek és infrastruktúra2026. szeptember 23.

NVIDIA NVCRE: GPU-klaszterek tesztelése éles AI-terhelés előtt

Valódi elosztott AI-terhelésekkel ellenőrizné a GPU-klaszterek éles üzemre való alkalmasságát az NVIDIA Cluster Readiness Engine. A nyílt forrású Kubernetes-vezérlő…

NVIDIA: generatív ajánlórendszerek válthatják le a hagyományos RecSys-modelleket
Fejlesztőknek2026. augusztus 20.

NVIDIA: generatív ajánlórendszerek válthatják le a hagyományos RecSys-modelleket

Az NVIDIA Developer 2026. augusztus 20-án közzétett bejegyzése szerint a generatív ajánlórendszerek a felhasználói előzmények alapján következő elemet vagy műveletet…