Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

2026. október 2. 21:55Forrás: PyTorch

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA Hopper GPU-kon végzett mérésekben a megoldás egyes terheléseknél több mint 10 százalékos átviteli teljesítmény-növekedést ért el.

A lényeg röviden
  • A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be.
  • Egy GEMM-implementáció a Standard, Split-K és Swap-AB változatokat is kezeli.
  • Az AOT autotuner alakfüggően választ algoritmust és kernelkonfigurációt.
  • Hopper GPU-kon a megoldás egyes terheléseknél több mint 10 százalékos javulást ért el.
  • A finomhangolás órákig tarthat, és indítási, illetve CPU-terhelési költséggel járhat.

Egyetlen GEMM-implementáció több algoritmust kezel

A vLLM nagy nyelvi modellek kiszolgálására szolgáló, nagy teljesítményű következtetési keretrendszer. A kvantált lineáris rétegekhez, például az FP8, INT8, INT4 és NVFP4 formátumokhoz, különleges backende­ket használ, amelyek olyan optimalizált kernelkönyvtárak megoldásaira támaszkodnak, mint a CUTLASS, a DeepGEMM és a FlashInfer.

A PyTorch közleménye szerint a Helion egy PyTorch-alapú, hardverfüggetlen kernel-DSL, amely csempézett programozási modellt használ. A fejlesztők egyetlen, tömör Python-szerű implementációt írhatnak, a rendszer pedig különböző munkaterhelésekhez és hardverekhez specializált kódot állít elő.

A vLLM-hez készített Helion lineáris backend egyetlen általános mátrixszorzási, vagyis GEMM-implementációban kezeli a hagyományos GEMM-et, a Split-K és a Swap-AB változatot is. A Split-K a K dimenziót több szálblokk között osztja fel, amikor az M vagy az N dimenzió túl kicsi a párhuzamosság megfelelő kihasználásához. A Swap-AB az A@B műveletet alakítja át, hogy kedvezőbb csempézést és jobb GPU-kihasználtságot tegyen lehetővé kis M dimenzió esetén.

Az automatikus hangolás választja ki a megfelelő változatot

A hagyományos megközelítésben a kernelfejlesztők több GEMM-változatot valósítanak meg, majd kézzel kialakított szabályokkal választják ki, hogy egy adott bemeneti alakhoz melyik fusson. A PyTorch példaként említi, hogy a vLLM jelenlegi Block_FP8 lineáris back­endje Hopper GPU-kon akkor használja a Swap-AB változatot, ha az M értéke 32-nél kisebb.

A Helion ezzel szemben hangolható paraméterként kezeli ezeket az algoritmikus döntéseket. A rendszer előzetes, futtatás előtti automatikus hangolója, az AOT autotuner, a munkaterheléshez legjobban illő algoritmust és az alacsony szintű kernelkonfigurációt is kiválasztja. A keresés a memóriakiosztástól és az ütemezéstől a magasabb szintű algoritmikus választásokig terjed.

A vizsgált backend az NVIDIA Hopper GPU-kra és a Helion Triton backendjére összpontosít. A célzott kvantálási formátumok az FP8_Dynamic, a W8A8_INT8 és a Block_FP8. A PyTorch szerint a Hopperen végzett tesztekben a Helion lineáris backend, az alakfüggő hangolással és a hibrid elosztással, a vizsgált modelleken felülmúlta a vLLM alapértelmezett CUTLASS és DeepGEMM back­endjeit.

A teljesítményért hangolási és üzemeltetési költséget kell vállalni

A PyTorch megközelítésének egyik előnye, hogy a felhasználók saját telepítésükhöz is tovább hangolhatják a kernelek teljesítményét speciális kernelfejlesztési ismeretek vagy jelentős mérnöki munka nélkül. A Helion emellett LLM-ek által irányított keresést is támogat, amely a nyelvi modellek következtetési képességeit strukturált numerikus optimalizálással kombinálja.

A megoldásnak ugyanakkor korlátai is vannak. A finomhangolás órákig tarthat, elsősorban a hangolási stratégia részletessége miatt. A vLLM indításakor a CUDA Graph rögzítése Helion JIT-fordítást indít, ami növelheti a hidegindítás késleltetését. A lefordított artefaktumok gyorsítótárazása ezt meleg indításoknál nagyrészt megszüntetheti.

A CUDA Graph hatókörén kívül a kernel elosztása és indítása további CPU-terhelést okozhat, ami részben ellensúlyozhatja a finomhangolás előnyeit. A PyTorch szerint a Helion ezért leginkább CUDA Graph alatt hatékony. A népszerű modellekhez előre hangolt konfigurációk szállítása közben folyamatos karbantartási terhet jelent, mivel a nagy konfigurációs fájlokat nehéz teljes körűen ellenőrizni.

A munka jelenleg Hopper GPU-kra korlátozódik. A Helion CuteDSL backendjének kezdeti eredményei versenyképes GEMM-teljesítményt mutattak NVIDIA Blackwell GPU-kon, a Blackwell támogatásának kiterjesztését azonban a backend további éréséhez kötik.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2. 23:09

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

Fejlesztőknek
Fejlesztőknek2026. szeptember 22. 17:45

Hardverfüggetlen rétegekkel alakítja át a vLLM-et a PyTorch

A vLLM új, hardverfüggetlen rétegeket kap, hogy a projekt a legújabb GPU-kra szabott optimalizációk mellett továbbra is támogassa a régebbi GPU-kat és a külső…