Az NVIDIA szerint 2,5-szer több felhasználót bír a Nemotron 3 Ultra NIM

Akár 2,5-szer nagyobb rendszer-áteresztést ért el a Nemotron 3 Ultra NIM az NVIDIA mérése szerint egy 4xB200 konfiguráción, a NIM nélküli alap kiszolgálási stackhez képest. A vállalat a 2026. szeptember 10-én közölt fejlesztői blogban azt mutatta be, hogyan növeli a NIM 2.0.12 az egyidejű felhasználók számát agentikus AI-terhelés alatt.
- Az NVIDIA szerint a Nemotron 3 Ultra NIM akár 2,5-szer nagyobb rendszer-áteresztést ad 4xB200 rendszeren.
- A NIM Off baseline 718 tok/s, a NIM On 2.0.12 optimalizált stack 1 997 tok/s értéket ért el 50 TPS/user célnál.
- Az optimalizációk között szerepel a prefix és állapot újrahasználása, az MTP spekulatív dekódolás, az autotuningolt kernel és az ütemezési hangolás.
- Az NVIDIA szerint a közzétett mérések kiindulópontok, a fejlesztőknek saját forgalommal kell tesztelniük.
- A NIM Certified frissítéseket, CVE-kezelést, hardvervalidációt és kereskedelmi támogatást kínál az NVIDIA AI Enterprise-on keresztül.
A cél: több párhuzamos felhasználó azonos interaktivitás mellett
Az NVIDIA Developer blogbejegyzése szerint egy nagy nyelvi modell telepítése csak az első lépés a termelési környezetben használható kiszolgálás felé. A fejlesztőcsapatoknak azt is meg kell oldaniuk, hogy a rendelkezésre álló GPU-infrastruktúrán minél több párhuzamos felhasználót szolgáljanak ki, miközben az alkalmazás válaszkészsége megmarad.
A vállalat szerint ez különösen fontos az agentikus AI-terheléseknél, ahol a promptok hosszúak lehetnek, a kontextus több lépésen át újrahasznosítható, és az alkalmazások gyakran hosszabb válaszokat streamelnek vissza a felhasználóknak.
Az NVIDIA NIM célja, hogy a modellhez és a GPU-hoz igazított kiszolgálási döntéseket telepíthető mikroszolgáltatásba csomagolja. A fejlesztők így nem üres futtatókörnyezeti konfigurációból indulnak, hanem validált kiszolgálási beállítást és támogatott telepítési útvonalat kapnak, miközben saját forgalmukkal is mérhetik a NIM teljesítményét.
Mit mért az NVIDIA a 4xB200 rendszeren
A blogban szereplő esettanulmány a Nemotron 3 Ultra NIM-et vizsgálta. A mérés hardvere 4xB200 volt, az agentikus munkaterhelés pedig 64K/400/76% KV reuse/50 TPS/user, 20 ms ITL céllal. Az NVIDIA a NIM nélküli, nyílt forrású alap kiszolgálási stacket hasonlította össze a teljesen optimalizált NIM 2.0.12 kiszolgálási stackkel.
Az eredmény szerint 50 TPS/user célnál a NIM bekapcsolt állapotban több mint 2,5-szeres rendszer-áteresztést adott a baseline megoldáshoz képest. A táblázatban a NIM Off baseline 718 tok/s értéket ért el, míg a NIM On 2.0.12 optimalizált kiszolgálási stack 1 997 tok/s teljesítményt mutatott.
Az NVIDIA ezt úgy értelmezi, hogy az optimalizált NIM stack ugyanazon interaktivitási cél mellett közvetlenül több egyidejű felhasználót jelenthet. A blog a NIM On konfiguráció részeként említi a cache és állapot újrahasználatát, az MTP spekulatív dekódolást és kapcsolódó javításait, az autotuningolt kerneleket, a részleges prefix-illesztést, valamint az ütemezés, batch-elés, memória és párhuzamosítás hangolását.
A gyorsulás nem egyetlen kapcsolóból jön
Az NVIDIA hangsúlyozza, hogy a mért nyereség egymással kölcsönhatásban lévő konfigurációs csomagokból származik. A blog szerint ezek nem különálló kapcsolók, amelyek százalékos hatása egyszerűen összeadható.
Az egyik réteg a precizitás és a modellhez igazított, autotuningolt kernelek használata. A cikk szerint az autotuningolt mixture-of-experts és Mamba kernelek hatékonyan képezik le a hibrid architektúrát NVIDIA Blackwell GPU-kra.
A párhuzamos végrehajtásnál a tensor parallelism négy GPU-ra osztja szét a modellt, míg az expert-aware végrehajtás a mixture-of-experts rétegek kihasználtságát javítja. A prefix és modellállapot újrahasználása szintén fontos: a prefix caching elkerüli az ismételt kontextus újraszámítását, a partial-prefix matching akkor is visszanyerhet újrahasználatot, ha csak a prefix egy része egyezik, a Mamba state-cache beállításait pedig a modellarchitektúrához hangolták.
A scheduler, a batch-elés és a memóriahangolás a párhuzamos szekvenciák korlátait, a batch-elt tokenek limitjét, a blokkméretet és a GPU-memória allokációját állítja úgy, hogy több munka maradjon folyamatban a késleltetési cél átlépése nélkül. A NIM 2.0.12 emellett MTP spekulatív dekódolást is hozzáad az optimalizált stackhez, amelynek többlethatása az elfogadási aránytól és a rendelkezésre álló memóriatartaléktól függ.
Saját forgalommal kell ellenőrizni a beállításokat
Az NVIDIA szerint a közzétett görbék kiindulópontot jelentenek, nem ígéretet arra, hogy minden alkalmazás ugyanilyen eredményt lát majd. A vállalat azt javasolja, hogy a fejlesztők reprezentatív forgalmat játsszanak vissza, és a saját felhasználóik számára fontos késleltetési metrikára építsenek Pareto-görbét.
A javasolt folyamat első lépése a pontos szoftververziók telepítése. A blog a NIM 2.0.12, vagy újabb verzió használatát említi, valamint azt, hogy minden futtatásnál rögzíteni kell az image taget vagy digestet.
A következő lépés a reprezentatív forgalom előkészítése. Ehhez az NVIDIA Mooncake formátumú JSONL trace használatát vagy kontrollált NIM kérések rögzítését javasolja, megfelelő hozzáférésvezérléssel és az érzékeny adatok tisztításával. A méréshez a cikk az NVIDIA AIPerf eszközt nevezi meg, amellyel reprezentatív forgalom játszható vissza teljesítményméréshez.
A fejlesztőknek ezután azt a Pareto-pontot kell kiválasztaniuk, amely megfelel az SLO-nak. A blog példát is ad egy AIPerf concurrency sweep parancsra, ahol a párhuzamossági értékek 1, 4, 8, 16, 32 és 64.
Mit jelent ez a fejlesztőknek és az üzemeltetőknek
A bejelentés gyakorlati üzenete az, hogy az NVIDIA a NIM-et teljesítményre hangolt indulópontként pozicionálja termelési kiszolgáláshoz. A Nemotron 3 Ultra esetében a vállalat mérése szerint a 4xB200 rendszeren elért optimalizációk akár 2,5-szer több felhasználó kiszolgálását teszik lehetővé 50 TPS/user cél mellett, a NIM nélküli baseline-hoz képest.
A NIM emellett a telepítési életciklusra is választ próbál adni. Az NVIDIA szerint a NIM Certified rendszeres inference-stack frissítéseket, CVE-kezelést, szélesebb hardvervalidációt és kereskedelmi támogatást ad az NVIDIA AI Enterprise keretében.
A fejlesztők az NVIDIA útmutatása alapján a Nemotron 3 Ultra NIM 2.0.12 csomagot az NGC-ről tölthetik le, saját NVIDIA GPU-infrastruktúrán futtathatják, majd NVIDIA AIPerf-fel visszajátszhatják a reprezentatív forgalmat. A vállalat azt is közölte, hogy több teljesítményre optimalizált NIM-konfigurációt tervez szélesebb modellkörre, hogy a fejlesztők további validált kiindulópontokat kapjanak saját késleltetési, áteresztési és költségcéljaikhoz.
NVIDIA Developer: How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra


