Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA bemutatta az AIPerfet, amely nagy terhelésű LLM-mérésekre készült

2026. szeptember 18. 21:04Forrás: NVIDIA Developer
Az NVIDIA bemutatta az AIPerfet, amely nagy terhelésű LLM-mérésekre készült
Kép: NVIDIA Developer

Az NVIDIA AIPerf a GenAI-Perf utódjaként érkezik, és olyan nagy terhelésű nyelvimodell-mérésekhez készült, amelyeknél maga a tesztelő kliens sem válhat szűk keresztmetszetté. Az eszköz többféle forgalmi mintát, nyilvános adatkészleteket és GPU-telemetriát is támogat.

A lényeg röviden
  • Az AIPerf a GenAI-Perf utódja, és többfolyamatos architektúrát használ.
  • Az eszköz több mint 15 végponttípust, valamint ShareGPT és forgalmi nyomkövetési formátumokat támogat.
  • A terhelés állandó, Poisson- vagy gamma-eloszlású érkezési mintával alakítható.
  • A rendszer TTFT, ITL, kéréskésleltetés és kimeneti token-áteresztőképesség alapján mér.
  • DCGM vagy pynvml használatával GPU-telemetria is bekerülhet az eredményekbe.

A GenAI-Perf utódja új architektúrával

Az NVIDIA szeptember 18-án ismertette az AIPerfet, amely a vállalat szerint a GenAI-Perf kijelölt utódja, és teljesen újraírt rendszerként készült. Az AIPerf már nem a Perf Analyzerre épül, ahogy a GenAI-Perf tette. A váltás az NVIDIA szerint olyan architekturális változást jelent, amely lehetővé teszi a nagyobb léptékű méréseket.

A fejlesztés egyik célja, hogy a terhelést generáló kliens ne torzítsa a szerver mérési eredményeit. A GenAI-Perfhez hasonló, egyetlen folyamatra épülő megoldások nagy párhuzamosság vagy magas kérésenkénti sebesség mellett a Python GIL korlátjába ütközhetnek. Az AIPerf ezzel szemben több folyamatot használ: külön munkafolyamatok generálják a terhelést, az eredményeket pedig külön rekordfeldolgozó szolgáltatások kezelik. Az összetevőket ZMQ koordinálja.

Sokféle végpont és forgalmi minta

Az AIPerf több mint 15 végponttípust támogat. Ezek között szerepelnek a csevegési és válaszalapú végpontok, a NIM-rangsorolások, a képgenerálás és további használati módok. A tesztekhez nyilvános adatkészletek, köztük a ShareGPT, valamint a Mooncake, a Baseten és a WEKA AgentX formátumú forgalmi nyomkövetései is használhatók.

A terhelés alakja is beállítható. A rendszer állandó, Poisson- és gamma-eloszlású érkezési mintákat kezel, amelyeknél a kitörésszerű forgalom mértéke szabályozható. Lehetőség van fokozatos felfutásra a párhuzamosság és a kérési sebesség tekintetében, továbbá változó bemeneti és kimeneti szekvenciahosszokat utánzó szintetikus eloszlásokra is.

Az NVIDIA bemutatója egy Qwen3-0.6B modellt használ vLLM-kiszolgálóval. A választás oka a forrás szerint az, hogy a modell egyetlen GPU-n is futtatható, így gyorsan ismételhetők a mérések. A példa célja a mérési folyamat bemutatása, a modell cseréje pedig egyetlen kapcsoló módosításával megoldható.

AIPerf mérőszámok és gyakorlati jelentőségük

A teszt lefutása után az AIPerf mérési táblázatot jelenít meg a konzolon, a teljes eredményeket pedig CSV és JSON formátumban menti. A négy kiemelt mutató a TTFT, vagyis az első tokenig eltelt idő, az ITL, vagyis az egymást követő tokenek közötti idő, a teljes kérés késleltetése, valamint a kimeneti tokenek áteresztőképessége.

A TTFT elsősorban az interaktív használat késleltetési mutatója. A magas ITL arra utalhat, hogy a dekódolási szakasz nehézségekbe ütközik, még akkor is, ha az első token gyorsan megérkezik. A kérés késleltetése a teljes válasz elküldéséig tartó időt mutatja, a kimeneti tokenek áteresztőképessége pedig a kapacitástervezés egyik fő mérőszáma.

A mutatókhoz p25, p50, p75, p90, p95 és p99 percentilisek, továbbá minimum-, maximum-, átlag- és szórásértékek tartoznak. Ez a részletezés a hosszú farokeloszlások felismerését segíti. Ha a DCGM vagy a pynvml elérhető, az eszköz a GPU energiafogyasztását, kihasználtságát és memóriahasználatát is rögzíti. A felhasználók így ugyanabban a mérésben kapcsolhatják össze a késleltetési kiugrásokat és a GPU állapotát.

Az AIPerf azoknak a mérnököknek lehet hasznos, akik egy gyors szintetikus ellenőrzést, illetve rögzített éles forgalom visszajátszását is ugyanazzal az eszközzel szeretnék elvégezni. Az NVIDIA migrációs útmutatót is kínál a GenAI-Perfről áttérőknek.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe
Chipek és infrastruktúra2026. október 2. 16:12

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe

A CoreWeave és az NVIDIA több mint 3500 NVIDIA H100 Tensor Core GPU-val, 11 percnél rövidebb idő alatt teljesítette az új MLPerf GPT-3 175B tesztet. A vállalatok szerint…