Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Rekordszámú résztvevővel érkezett az MLPerf Inference v6.1

2026. szeptember 17. 17:00Forrás: MLCommons
Rekordszámú résztvevővel érkezett az MLPerf Inference v6.1
Kép: MLCommons

Az MLPerf Inference v6.1 minden korábbinál szélesebb mezőnyt hozott, 30 szervezet összesen 120 rendszert nevezett. A szeptember 17-i elemzés szerint a fordulóban az ügynökalapú és végponttól végpontig tartó mérések, valamint az új hardverek kapták a főszerepet.

A lényeg röviden
  • Az MLPerf Inference v6.1-ben 30 résztvevő és 120 rendszer szerepelt.
  • Új benchmark lett az End-to-End RAG és az Agentic Edge Inference.
  • A llama2-70b Server teljesítménye hat forduló alatt 5,58-szorosára nőtt.
  • A DeepSeek R1 egy év alatt 5,7-szeres javulást ért el Server forgatókönyvben.
  • A Crusoe 512 gyorsítós rendszerekkel új méretrekordot állított fel.

Rekordot döntött a résztvevők és rendszerek száma

Az MLCommons szerint a v6.1-es fordulóban 30 résztvevő adott be eredményeket. A mezőnyben lapkagyártók, rendszergyártók, felhőszolgáltatók, neoklaszter-szolgáltatók és inferenciaszoftverekre szakosodott vállalatok szerepeltek. Több eredmény közös nevezésként született, ilyen volt a Dell_AMD, a Dell_MangoBoost, a RedHat_Intel és a RedHat_Supermicro párosítása.

A Datacenter és Edge kategóriákban, a Closed és Open divíziókban összesen 120 rendszert neveztek. A Closed mérésekben matematikailag ekvivalens modellt kell használni a referenciaimplementációval, így az eredmények közvetlenebbül összehasonlíthatók.

Új tesztek kerültek az ügynökalapú rendszerekhez

Az MLPerf Inference v6.1 tíz adatközponti és hat peremhálózati tesztet tartalmaz. Két új benchmark jelent meg: az adatközponti End-to-End RAG és a peremhálózati Agentic Edge Inference. A Visual Language Model, vagyis vizuális nyelvi modell alapú Qwen3 méréséhez új Interactive forgatókönyv készült, a GPT-OSS-120B interaktív tesztje pedig már spekulatív dekódolást is engedélyez.

Az adatközponti tesztek közül először a gpt-oss-120b lett a legnépszerűbb, 54 rendszerrel. Ezt a llama2-70b követte 39 rendszerrel. Az MLCommons ezt annak jeleként értékeli, hogy a teljesítménymérés közössége egyre inkább elfogadja a Mixture of Experts, vagyis MoE modelleket, miközben továbbra is fontosnak tartja a stabilitást és az összehasonlíthatóságot.

A peremhálózati készletben az Agentic Edge Inference öt rendszerrel szerepelt. A teszt SingleStream forgatókönyvet használ, és az ügynökalapú feldolgozás eszközön történő vizsgálatát célozza.

Jelentős gyorsulás a modellek és a rendszerek teljesítményében

A v6.1 eredményeinek a v6.0 legjobb gyorsítónkénti Offline és Server értékeivel való összevetése szerint a legnagyobb javulás a VLM és a DeepSeek R1 tesztben látható. Ezek csúcseredményei az Nvidia Vera Rubin platformjára épülő, új Preview kategóriás rendszeren születtek. A többi benchmark legjobb eredménye ugyanazon a hardveren készült, mint a v6.0-ban, ezért ott fokozatosabb javulást hoztak a szoftveres és algoritmikus fejlesztések.

A llama2-70b Server forgatókönyvének medián, gyorsítónkénti teljesítménye hat forduló alatt 5,58-szorosára nőtt. Az MLCommons három fő okot emel ki: egyes v6.1-es nevezések már FP4 pontosságot használnak az előző fordulók FP8 értékei helyett, új generációs gyorsítók váltották le a korábbi hardvert, és minden fordulóban javul a szoftveres teljesítmény.

A DeepSeek R1 esetében egy éven belül 2,7-szeres növekedést mértek Offline, illetve 5,7-szereset Server forgatókönyvben. Az Interactive forgatókönyv teljesítménye ugyanebben az időszakban 2,7-szeresére emelkedett.

Nagyobb, több gyorsítót használó rendszerek jelentek meg

A több csomóponton futó inferencia is tovább terjed. A v6.1 fordulóban rekordot jelentő 16 többcsomópontos nevezés érkezett, a növekedés az MLPerf 4.1-es fordulója óta látható. A nevezett rendszerek mérete szintén nőtt: a korábbi, 288 gyorsítós rekordot ebben a körben a Crusoe két nevezése döntötte meg 512 gyorsítóval.

Az egyik Crusoe-rendszer a GPT-OSS-120B Offline tesztben csaknem 5,8 millió tokent generált másodpercenként, ami új rekordot jelentett az MLPerf Inference benchmarkban. A fordulóban két olyan nevezés is szerepelt, amely különböző típusú gyorsítókat dolgoztatott együtt. A Cisco például nyolc NVIDIA H200 és nyolc AMD Instinct MI350X GPU-t kapcsolt egyetlen inferenciakészletbe Cisco G200 Network hálózaton keresztül.

A v6.1 eredményei így egyszerre mutatják az új modellek és az ügynökalapú feladatok előretörését, valamint az inferenciahardverek skálázódását. A felhasználók és szolgáltatók számára a forduló több összehasonlítható adatot ad az adatközponti, peremhálózati és többgyorsítós rendszerek teljesítményéről.

Kapcsolódó hírek

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél
Biztonság és etika2026. október 1. 20:01

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél

Az MLCommons közzétette az AI-ügynökök adatvédelmi kockázatainak első taxonómiáját. A dokumentum öt fő területet különít el, a begyűjtött adatok kezelésétől az…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…