Az NVIDIA szerint 49,2 százalékkal nőhet az AI-infrastruktúra áteresztőképessége

Az NVIDIA DSX MaxLPS technológiája egy tesztben 49,2 százalékkal növelte az összesített áteresztőképességet ugyanazon, 264,4 kilowattos jóváhagyott teljesítménykeret mellett. A megoldás 140 helyett 192 GPU kezelését tette lehetővé, miközben az egyes munkamenetek teljesítménye lényegében változatlan maradt.
- A DSX MaxLPS ugyanazon 264,4 kW-os keret mellett 140-ről 192-re növelte a kezelt GPU-k számát.
- Az összesített áteresztőképesség 49,2 százalékkal, 1 084 503-ról 1 618 443 token/másodpercre nőtt.
- A nagy áteresztőképességű és az alacsony késleltetésű példányok egyedi teljesítménye lényegében változatlan maradt.
- A 99. percentilishez tartozó elsőtoken-késleltetés 17 százalékkal emelkedett.
A kihasználatlan teljesítményre épít a DSX MaxLPS
Az NVIDIA szeptember 27-én közzétett fejlesztői bejegyzése szerint az AI-infrastruktúrákat gyakran úgy méretezik, hogy minden GPU egyidejű csúcsteljesítményét elbírják. A tényleges munkaterhelés azonban változó: a betanítási feladatok számítási, kommunikációs, szinkronizációs és ellenőrzőpont-készítési szakaszokon mennek keresztül, míg a következtetés különböző terhelési és várakozási időszakokat váltogat.
Statikus teljesítményfoglalás mellett az egyik csomópont fel nem használt kerete nem osztható ki egy másiknak. Így az adatközpont a teljes kereten belül maradhat, miközben további GPU-k offline állapotban maradnak. A DSX MaxLPS a tényleges fogyasztást figyeli, és az üzemeltető által meghatározott szabályok szerint osztja újra a rendelkezésre álló teljesítményt.
Öt elemből áll a vezérlési folyamat
A megoldás a chip-, rendszer-, hőmérsékleti és szoftveres technológiákat hangolja össze a szárazföldi, teljesítmény- és adatközponti kapacitáskorlátok, azaz az LPS-korlátok mellett. A Dynamic Power Software biztosítja a szabályok alapján történő teljesítményelosztás vezérlési rétegét.
- Az üzemeltető feltérképezi az infrastruktúrát, és erőforráscsoportokat határoz meg.
- A rendszer GPU-, csomópont-, rack- és csoportszintű fogyasztási adatokat gyűjt.
- A szabályok rögzítik a csomóponti és csoportszintű korlátokat, a prioritásokat, a tartalékokat, valamint a karbantartási és vészhelyzeti válaszokat.
- Az alacsonyabb fogyasztású erőforrásoktól felszabaduló keretet a szoftver más GPU-khoz rendelheti.
- A rendszer összeveti a mért fogyasztást a jóváhagyott csoportkerettel, és szükség esetén módosítja az allokációt.
Az NVIDIA hangsúlyozza, hogy ez az eljárás nem növeli a telephely áramellátását. A cél a produktívabb működés ugyanazon kezelt teljesítménykereten belül.
Az Nscale tesztjében 140 helyett 192 GPU működött
Az NVIDIA és az Nscale közös értékelését az Nscale keflavíki, Verne campuson működő adatközpontjában végezték, amely teljes egészében megújuló energiával működik. A tesztben NVIDIA GB300 NVL72 rendszerek, NVIDIA Blackwell Ultra GPU-k, FP4-ben futó Kimi K2.5, NVIDIA Dynamo és NVIDIA TensorRT LLM szerepelt. A bemeneti szekvencia hossza 8K, a kimeneté 1K volt.
A statikus alapkonfiguráció 35, egyenként négy GPU-t tartalmazó csomópontból állt, összesen 140 GPU-val. Ebben két, egyenként 52 GPU-s nagy áteresztőképességű példány és egy 36 GPU-s, alacsony késleltetésre beállított példány futott. A DSX MaxLPS-konfiguráció 48 négy-GPU-s csomópontot, vagyis 192 GPU-t használt. Ehhez egy harmadik, 52 GPU-s nagy áteresztőképességű példányt adtak hozzá, a 36 GPU-s alacsony késleltetésű példány megtartása mellett.
Mindkét konfiguráció ugyanazt a 264,4 kilowattos biztosított teljesítménykeretet használta. A munkafolyamatokat négy rack között futtatták, és az elosztott terheléseket mindkét esetben egyetlen rackre korlátozták, hogy kizárják a rackek közötti teljesítménykülönbségeket.
Nagyobb összteljesítmény, változatlan példányonkénti eredmények
A kezelt GPU-k száma 140-ről 192-re, 37,1 százalékkal nőtt. Az összesített áteresztőképesség 1 084 503 token/másodpercről 1 618 443 token/másodpercre emelkedett, ami 49,2 százalékos javulás. A nagy áteresztőképességű példányok kimenete példányonként 59 153-ról 59 220 token/másodpercre változott, az alacsony késleltetésű példányé pedig mindkét konfigurációban 2 265 token/másodperc maradt.
A mért teljesítmény 166,2 kilowattról 198,9 kilowattra nőtt, miközben a GPU-k átlagos teljesítményfelvétele 97,0-ről 131,8 kilowattra emelkedett. A teljesítménykeret kihasználása 62,9 százalékról 75,2 százalékra változott. A biztosított wattonkénti áteresztőképesség 4,10-ről 6,12 token/másodpercre nőtt.
A késleltetés mediánja és 75. percentilise az alapkonfigurációhoz képest 5 százalékon belül maradt. A 99. percentilishez tartozó, első tokenig eltelt idő ugyanakkor 17 százalékkal nőtt a 15,7 másodperces alapértékhez képest. Ez az NVIDIA szerint arra utal, hogy a kapacitásnövekedés mellett a ritkább, hosszabb várakozási eseteket is külön vizsgálni kell.
NVIDIA Developer: How NVIDIA DSX MaxLPS Maximizes AI Factory Throughput and Efficiency


