Az NVIDIA bemutatta az AIPerfet, amely nagy terhelésű LLM-mérésekre készült

Az NVIDIA AIPerf a GenAI-Perf utódjaként érkezik, és olyan nagy terhelésű nyelvimodell-mérésekhez készült, amelyeknél maga a tesztelő kliens sem válhat szűk keresztmetszetté. Az eszköz többféle forgalmi mintát, nyilvános adatkészleteket és GPU-telemetriát is támogat.
- Az AIPerf a GenAI-Perf utódja, és többfolyamatos architektúrát használ.
- Az eszköz több mint 15 végponttípust, valamint ShareGPT és forgalmi nyomkövetési formátumokat támogat.
- A terhelés állandó, Poisson- vagy gamma-eloszlású érkezési mintával alakítható.
- A rendszer TTFT, ITL, kéréskésleltetés és kimeneti token-áteresztőképesség alapján mér.
- DCGM vagy pynvml használatával GPU-telemetria is bekerülhet az eredményekbe.
A GenAI-Perf utódja új architektúrával
Az NVIDIA szeptember 18-án ismertette az AIPerfet, amely a vállalat szerint a GenAI-Perf kijelölt utódja, és teljesen újraírt rendszerként készült. Az AIPerf már nem a Perf Analyzerre épül, ahogy a GenAI-Perf tette. A váltás az NVIDIA szerint olyan architekturális változást jelent, amely lehetővé teszi a nagyobb léptékű méréseket.
A fejlesztés egyik célja, hogy a terhelést generáló kliens ne torzítsa a szerver mérési eredményeit. A GenAI-Perfhez hasonló, egyetlen folyamatra épülő megoldások nagy párhuzamosság vagy magas kérésenkénti sebesség mellett a Python GIL korlátjába ütközhetnek. Az AIPerf ezzel szemben több folyamatot használ: külön munkafolyamatok generálják a terhelést, az eredményeket pedig külön rekordfeldolgozó szolgáltatások kezelik. Az összetevőket ZMQ koordinálja.
Sokféle végpont és forgalmi minta
Az AIPerf több mint 15 végponttípust támogat. Ezek között szerepelnek a csevegési és válaszalapú végpontok, a NIM-rangsorolások, a képgenerálás és további használati módok. A tesztekhez nyilvános adatkészletek, köztük a ShareGPT, valamint a Mooncake, a Baseten és a WEKA AgentX formátumú forgalmi nyomkövetései is használhatók.
A terhelés alakja is beállítható. A rendszer állandó, Poisson- és gamma-eloszlású érkezési mintákat kezel, amelyeknél a kitörésszerű forgalom mértéke szabályozható. Lehetőség van fokozatos felfutásra a párhuzamosság és a kérési sebesség tekintetében, továbbá változó bemeneti és kimeneti szekvenciahosszokat utánzó szintetikus eloszlásokra is.
Az NVIDIA bemutatója egy Qwen3-0.6B modellt használ vLLM-kiszolgálóval. A választás oka a forrás szerint az, hogy a modell egyetlen GPU-n is futtatható, így gyorsan ismételhetők a mérések. A példa célja a mérési folyamat bemutatása, a modell cseréje pedig egyetlen kapcsoló módosításával megoldható.
AIPerf mérőszámok és gyakorlati jelentőségük
A teszt lefutása után az AIPerf mérési táblázatot jelenít meg a konzolon, a teljes eredményeket pedig CSV és JSON formátumban menti. A négy kiemelt mutató a TTFT, vagyis az első tokenig eltelt idő, az ITL, vagyis az egymást követő tokenek közötti idő, a teljes kérés késleltetése, valamint a kimeneti tokenek áteresztőképessége.
A TTFT elsősorban az interaktív használat késleltetési mutatója. A magas ITL arra utalhat, hogy a dekódolási szakasz nehézségekbe ütközik, még akkor is, ha az első token gyorsan megérkezik. A kérés késleltetése a teljes válasz elküldéséig tartó időt mutatja, a kimeneti tokenek áteresztőképessége pedig a kapacitástervezés egyik fő mérőszáma.
A mutatókhoz p25, p50, p75, p90, p95 és p99 percentilisek, továbbá minimum-, maximum-, átlag- és szórásértékek tartoznak. Ez a részletezés a hosszú farokeloszlások felismerését segíti. Ha a DCGM vagy a pynvml elérhető, az eszköz a GPU energiafogyasztását, kihasználtságát és memóriahasználatát is rögzíti. A felhasználók így ugyanabban a mérésben kapcsolhatják össze a késleltetési kiugrásokat és a GPU állapotát.
Az AIPerf azoknak a mérnököknek lehet hasznos, akik egy gyors szintetikus ellenőrzést, illetve rögzített éles forgalom visszajátszását is ugyanazzal az eszközzel szeretnék elvégezni. Az NVIDIA migrációs útmutatót is kínál a GenAI-Perfről áttérőknek.
NVIDIA Developer: Benchmarking LLM Inference at Scale with AIPerf


