Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Nyílt forrású CUDA-kernellel gyorsítja a Kimi K2.x MoE futtatását a Novita

2026. szeptember 15.Forrás: Novita AI
Nyílt forrású CUDA-kernellel gyorsítja a Kimi K2.x MoE futtatását a Novita
Kép: Novita AI

A Novita AI nyílt forrásúvá tette a Chord nevű CUDA-kernelcsomagot, amely INT4-es, W4A16 formátumú Mixture-of-Experts modellek futtatását gyorsítja Kimi K2.x kiszolgálásakor. A megoldás a vLLM meglévő Humming backendjén keresztül is használható bizonyos konfigurációkban.

A lényeg röviden
  • A Novita AI nyílt forrásúvá tette a Chord W4A16 INT4 MoE CUDA-kernelt.
  • A megoldás Kimi K2.x modellekhez, H200 és Blackwell GPU-khoz készült.
  • Az indexed útvonal a vLLM meglévő Humming backendjén keresztül használható.
  • A grouped kernelcsalád vLLM-integrációja még fejlesztés alatt áll.
  • A közölt gyorsulás a tesztelt GPU-tól, útvonaltól és terhelési alakzattól függ.

Két kernelcsaládot kínál a Chord

A Chord BF16 aktivációkkal, INT4 súlyokkal és group-32 skálázással működő W4A16 MoE CUDA-operátor. A Novita AI közleménye szerint a csomagot kifejezetten a Kimi K2.x kiszolgálási alakzataihoz hangolták, és NVIDIA H200, valamint Blackwell GPU-kra szánják.

A projekt két, eltérő útvonalat tartalmaz. Az indexed család a nyilvános Humming megoldásából származik, és a vLLM által használt sorted_ids, expert_ids és num_tokens_padded útválasztási adatokat fogyasztja. Ez az útvonal H200 EP8 előtöltéshez, H200 TP8 egy példányos kiszolgáláshoz, H200 EP8 dekódoláshoz, valamint B200 és B300 EP8 dekódoláshoz kínál profilokat.

A grouped_contiguous előtöltési és grouped_masked dekódolási kernel egy második, SM90-es családot alkot. Ezek DeepGEMM-alapokra épülnek, csoportosított útválasztást használnak, és eltérő, csomagolt súlyformátummal dolgoznak. A vLLM-mel való integrációjuk a bejelentés szerint még fejlesztés alatt áll.

A vLLM Humming backendjén keresztül telepíthető

A Novita AI telepítési útmutatója szerint a Chord GitHubról telepíthető, majd a vLLM-ben a --quantization humming kapcsolóval vagy a moe_backend="humming" beállítással választható ki. A csomag a chord és a humming modulgyökeret is biztosítja. A közlemény külön kéri, hogy a felhasználók ne telepítsék mellé az inclusionAI/humming csomagot, mert a Chord szándékosan maga kezeli ezt az importnevet.

A vLLM lusta betöltésű felülete a humming.{dtypes,config,layer,schema,utils.weight} modulokat oldja fel. Az indexed útvonal így Chord-specifikus keretrendszer-módosítás nélkül használható azokon a vLLM-ágakon, amelyek támogatják a WNA16 group-scale formátumot. A csomag a Kimi K2.x által használt, uint4, group-32 és BF16 skálákat, valamint a compressed-tensors formátumú INT4 checkpointot támogatja.

A Novita AI szerint a nem támogatott kvantálási sémák betöltéskor hibát okoznak, így a rendszer nem választ csendben helytelen kernelt. A grouped útvonal vLLM-integrációja továbbra is készül, ezért jelenleg önálló API-ként érhető el.

A mért előny a terhelés alakjától függ

A Chord teljesítménye a közzétett mérések szerint a vizsgált konfigurációtól függ. A nyilvános Humming megfelelő útvonalához képest H200 EP8 előtöltésnél 1,11 és 1,20 közötti, H200 TP8 egy példányos kiszolgálásnál pedig 1,17 és 1,33 közötti gyorsulást mértek. H200 EP8 dekódolásnál az eredmény 1,16 és 1,24 közé esett, a down szakasz pedig elérte az 1,31-es értéket.

B300 EP8 dekódolásnál 1,81 és 2,15 közötti értékeket közöltek. Ebben az esetben az összehasonlítás a Humming alapértelmezett, hangolás nélküli konfigurációjával történt, mivel a nyilvános Humming nem tartalmaz SM100 és SM103 hangolási táblát. A grouped H200 EP8 útvonalaknál az előtöltési mérés 1,00 és 1,31, a dekódolási 1,16 és 1,35 közötti eredményeket mutatott. A táblázatok EP16 esetén 1,18 és 1,34, EP32 esetén pedig 1,13 és 1,30 közötti értékeket is tartalmaznak.

A Novita AI hangsúlyozza, hogy ezek kernelenkénti mérések, ezért nem jelentenek minden munkaterhelésre azonos végponttól végpontig tartó gyorsulást. Az eredményeket a 2026. szeptember 14-i, 7ca91d8 azonosítójú kódállapot alapján közölték.

A kernel a szakértőkhöz és az üzemeltetőkhöz szól

A Chord tervezésének alapja, hogy egyetlen W4A16 MoE-kernel nem feltétlenül megfelelő minden kéréshez. A szakértőnként útvonalazott tokenek száma az előtöltés és a dekódolás között nagyságrendekkel eltérhet, ezért a Chord a kapott alakzat alapján választ ütemezést. Az indexed profiloknál a rendszer többek között a szakértőnkénti tokenmennyiséget, a blokk-méretet és a GPU-foglaltságot veszi figyelembe.

A vLLM-felhasználóknak explicit módon kell kiválasztaniuk a Humming backendet, mert a vLLM automatikus WNA16-prioritása más backendet is előnyben részesíthet. A közlemény szerint a VLLM_HUMMING_USE_F16_ACCUM és a VLLM_BATCH_INVARIANT beállítást ki kell kapcsolva hagyni, mivel egyik backend sem valósítja meg ezeket a számítási módokat. A teljes alakzatokat, mérési módszertant és kerneladatokat a Chord dokumentációja tartalmazza.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2. 23:09

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Novita AI új INT4 MoE-kernelt nyílt forráskódúvá tett a Kimi K2.x-hez
Fejlesztőknek2026. szeptember 15.

A Novita AI új INT4 MoE-kernelt nyílt forráskódúvá tett a Kimi K2.x-hez

A Novita AI nyílt forráskódúvá tette a Chord nevű, INT4 súlyokkal működő MoE CUDA-operátort, amelyet a Kimi K2.x kiszolgálási formáihoz fejlesztettek. A vLLM mérései…