Rekordszámú résztvevővel érkezett az MLPerf Inference v6.1

Az MLPerf Inference v6.1 minden korábbinál szélesebb mezőnyt hozott, 30 szervezet összesen 120 rendszert nevezett. A szeptember 17-i elemzés szerint a fordulóban az ügynökalapú és végponttól végpontig tartó mérések, valamint az új hardverek kapták a főszerepet.
- Az MLPerf Inference v6.1-ben 30 résztvevő és 120 rendszer szerepelt.
- Új benchmark lett az End-to-End RAG és az Agentic Edge Inference.
- A llama2-70b Server teljesítménye hat forduló alatt 5,58-szorosára nőtt.
- A DeepSeek R1 egy év alatt 5,7-szeres javulást ért el Server forgatókönyvben.
- A Crusoe 512 gyorsítós rendszerekkel új méretrekordot állított fel.
Rekordot döntött a résztvevők és rendszerek száma
Az MLCommons szerint a v6.1-es fordulóban 30 résztvevő adott be eredményeket. A mezőnyben lapkagyártók, rendszergyártók, felhőszolgáltatók, neoklaszter-szolgáltatók és inferenciaszoftverekre szakosodott vállalatok szerepeltek. Több eredmény közös nevezésként született, ilyen volt a Dell_AMD, a Dell_MangoBoost, a RedHat_Intel és a RedHat_Supermicro párosítása.
A Datacenter és Edge kategóriákban, a Closed és Open divíziókban összesen 120 rendszert neveztek. A Closed mérésekben matematikailag ekvivalens modellt kell használni a referenciaimplementációval, így az eredmények közvetlenebbül összehasonlíthatók.
Új tesztek kerültek az ügynökalapú rendszerekhez
Az MLPerf Inference v6.1 tíz adatközponti és hat peremhálózati tesztet tartalmaz. Két új benchmark jelent meg: az adatközponti End-to-End RAG és a peremhálózati Agentic Edge Inference. A Visual Language Model, vagyis vizuális nyelvi modell alapú Qwen3 méréséhez új Interactive forgatókönyv készült, a GPT-OSS-120B interaktív tesztje pedig már spekulatív dekódolást is engedélyez.
Az adatközponti tesztek közül először a gpt-oss-120b lett a legnépszerűbb, 54 rendszerrel. Ezt a llama2-70b követte 39 rendszerrel. Az MLCommons ezt annak jeleként értékeli, hogy a teljesítménymérés közössége egyre inkább elfogadja a Mixture of Experts, vagyis MoE modelleket, miközben továbbra is fontosnak tartja a stabilitást és az összehasonlíthatóságot.
A peremhálózati készletben az Agentic Edge Inference öt rendszerrel szerepelt. A teszt SingleStream forgatókönyvet használ, és az ügynökalapú feldolgozás eszközön történő vizsgálatát célozza.
Jelentős gyorsulás a modellek és a rendszerek teljesítményében
A v6.1 eredményeinek a v6.0 legjobb gyorsítónkénti Offline és Server értékeivel való összevetése szerint a legnagyobb javulás a VLM és a DeepSeek R1 tesztben látható. Ezek csúcseredményei az Nvidia Vera Rubin platformjára épülő, új Preview kategóriás rendszeren születtek. A többi benchmark legjobb eredménye ugyanazon a hardveren készült, mint a v6.0-ban, ezért ott fokozatosabb javulást hoztak a szoftveres és algoritmikus fejlesztések.
A llama2-70b Server forgatókönyvének medián, gyorsítónkénti teljesítménye hat forduló alatt 5,58-szorosára nőtt. Az MLCommons három fő okot emel ki: egyes v6.1-es nevezések már FP4 pontosságot használnak az előző fordulók FP8 értékei helyett, új generációs gyorsítók váltották le a korábbi hardvert, és minden fordulóban javul a szoftveres teljesítmény.
A DeepSeek R1 esetében egy éven belül 2,7-szeres növekedést mértek Offline, illetve 5,7-szereset Server forgatókönyvben. Az Interactive forgatókönyv teljesítménye ugyanebben az időszakban 2,7-szeresére emelkedett.
Nagyobb, több gyorsítót használó rendszerek jelentek meg
A több csomóponton futó inferencia is tovább terjed. A v6.1 fordulóban rekordot jelentő 16 többcsomópontos nevezés érkezett, a növekedés az MLPerf 4.1-es fordulója óta látható. A nevezett rendszerek mérete szintén nőtt: a korábbi, 288 gyorsítós rekordot ebben a körben a Crusoe két nevezése döntötte meg 512 gyorsítóval.
Az egyik Crusoe-rendszer a GPT-OSS-120B Offline tesztben csaknem 5,8 millió tokent generált másodpercenként, ami új rekordot jelentett az MLPerf Inference benchmarkban. A fordulóban két olyan nevezés is szerepelt, amely különböző típusú gyorsítókat dolgoztatott együtt. A Cisco például nyolc NVIDIA H200 és nyolc AMD Instinct MI350X GPU-t kapcsolt egyetlen inferenciakészletbe Cisco G200 Network hálózaton keresztül.
A v6.1 eredményei így egyszerre mutatják az új modellek és az ügynökalapú feladatok előretörését, valamint az inferenciahardverek skálázódását. A felhasználók és szolgáltatók számára a forduló több összehasonlítható adatot ad az adatközponti, peremhálózati és többgyorsítós rendszerek teljesítményéről.
MLCommons: Where the Industry Is Investing: A Look at MLPerf Inference v6.1


