A vLLM több mint háromszorosára gyorsította a MiniMax M3-at
A vLLM fejlesztései jelentősen javították a MiniMax M3 teljesítményét AMD Instinct MI355X GPU-kon. A standard MXFP8 kiszolgálás egy mérési ponton 3,14-szeresére gyorsult a kezdeti eredményhez képest.
- Az MXFP8 standard kiszolgálás 3,14-szeresére gyorsult 32-es konkurenciánál.
- A TP4/EP1 MXFP8 teljesítménye 623,7 kimeneti token volt GPU-nként másodpercenként 128-as konkurenciánál.
- Az MXFP4 TP2/EP1 beállításban 943,5 tokent ért el GPU-nként másodpercenként.
- Az EAGLE3 és a prefillszakasz, illetve dekódolás szétválasztása további teljesítménynövekedést hozott.
- A fejlesztések az indítási költségek és a felesleges adatmozgatás csökkentésére épültek.
Jelentősen nőtt az átviteli sebesség
A vLLM szeptember 10-i beszámolója szerint a MiniMax M3 első működő implementációja után több ponton is optimalizálták a modellt. A munkában szerepelt a MiniMax Sparse Attention, a multimodális bemenetek, a következtetési és eszközkimenetek, az MXFP8 súlyok, valamint az EAGLE3 támogatása.
A SemiAnalysis InferenceX nyilvános eredményei alapján, 32-es konkurenciánál a rögzített topológiájú, MXFP8-as standard kiszolgálás teljesítménye GPU-nként 109,1-ről 342,4 kimeneti tokenre nőtt másodpercenként. Ez a vLLM szerint a day-0 eredmény 3,14-szerese. A medián első tokenig eltelt idő 1,46 másodpercről 0,67 másodpercre csökkent, az átlagos tokenenkénti idő pedig 69,1-ről 22,1 milliszekundumra esett.
128-as konkurenciánál ugyanazon a TP4/EP1, négy GPU-s útvonalon 297,8-ról 623,7 kimeneti tokenre nőtt a GPU-nkénti sebesség másodpercenként. Ez 2,09-szeres javulás. A medián TTFT 3,53-ról 1,54 másodpercre, az átlagos TPOT 100,7-ről 48,8 milliszekundumra mérséklődött.
A topológia és a munkafolyamat is számít
Az MXFP4 teljesítménye 128-as konkurenciánál, TP4/EP1 beállítás mellett 212,1-ről 716,8 kimeneti tokenre javult GPU-nként másodpercenként. Egy későbbi TP2/EP1 eredmény 943,5 tokent ért el, ami 31,6 százalékkal magasabb a TP4-es mérési pontnál, és 4,45-szerese a kezdeti, GPU-nkénti eredménynek. A vLLM kiemeli, hogy a TP4-ről TP2-re váltás nagyobb telepítési sűrűséget is jelent, ezért ez nem rögzített topológiájú sebesség-összehasonlítás.
Az EAGLE3 spekulatív dekódolással 682,4 kimeneti tokent értek el másodpercenként és GPU-nként, 128-as konkurenciánál, TP4/EP1 konfigurációban. A prefillszakasz és a dekódolás szétválasztásával, valamint a topológia újrahangolásával 512-es konkurenciánál 6370,5 összesített tokent mértek GPU-nként másodpercenként, 1,32 másodperces medián TTFT mellett.
A fejlesztési folyamat középpontjában az állt, hogy minden lépésben az aktuális szűk keresztmetszetet azonosítsák. A MiniMax M3 60 dekóderréteget tartalmaz, ezek közül 57 ritka kevert szakértői és ritka figyelmi réteget használ. Egy 1K tokenes válasznál ezért egy kisebb, rétegenként jelentkező költség is több tízezerszer ismétlődhet egy kérés során.
Kevesebb indítás, kisebb adatmozgatás
A vLLM a tenzorpárhuzamosítás, a fejreplikáció és a tokenútvonalak miatt kialakuló helyi máreteket is vizsgálta. TP8 esetén a MiniMax M3 64 lekérdezési feje rankonként nyolcra oszlik, miközben a négy kulcsérték- és négy indexfej rankonként replikálódik. Emiatt az összevont QKV-projekció helyi N mérete 1536, nem a globális méret nyolcaddal osztott értéke.
A nagy és kis M értékekhez külön indítási módot vezettek be, ami TP8 mellett, 8K bemenettel és 1K kimenettel 7,8 és 9,4 százalék közötti javulást hozott. Egy további módosítás a helyi alakhoz választott csempéket, így dekódoláskor több független munkát lehetett feltárni, a prefillszakaszban pedig szélesebb csempéket használhattak. A TP4-es végpontok közötti tesztekben az összevont változtatások 1,08 és 1,46 közötti gyorsulást eredményeztek.
A ritka MoE-rétegeknél a közös szakértőt korábban külön sűrű MLP-útvonal futtatta. A vLLM ezt a szakértőt hozzáadta az útválasztott szakértők táblájához, így a csoportosított mátrixműveletek közösen kezelhették őket. A modell számításai megmaradtak, miközben csökkent az indítások és a köztes adatmozgatás száma. A javulás 30,2 százalék volt egyes konkurenciánál, és 5,6 százalék 128-as konkurenciánál.
A ritka figyelemnél a szomszédos rétegek gyakran hasonló blokkokat választanak. Az indexmegosztás lehetővé tette, hogy az egyik réteg kiszámítsa a kiválasztást, a későbbi rétegek pedig újra felhasználják. A vLLM mérései szerint ez a TPOT értékét körülbelül 10 százalékkal csökkentette egyes konkurenciánál, magas konkurenciánál pedig körülbelül 4 százalékos javulást hozott.


