Képgenerálással és ügynöki feladatokkal bővült az MLPerf Client
Az MLCommons kiadta az MLPerf Client v2.0-t, amely a személyi számítógépeken futó mesterséges intelligencia teljesítményét méri. Az új verzió a nyelvi modellek mellett képgenerálási és ügynöki AI-feladatokkal bővíti a teszteket.
- Megjelent az MLPerf Client v2.0 új verziója.
- A benchmark képgenerálási kategóriával bővült, benne a Flux.2 klein 4B kísérleti tesztjével.
- Az ügynöki AI-mérés SWE Agent és Data Analyst Agent forgatókönyveket tartalmaz.
- A Phi 3.5 mini instruct helyét a Phi 4 Mini Instruct vette át a kötelező tesztekben.
- A szoftver ingyenesen letölthető, forráskódja az MLCommons GitHub-tárházában elérhető.
Két új területtel bővült a mérés
Az MLCommons 2026. augusztus 18-án jelentette be az MLPerf Client v2.0 megjelenését. A benchmark személyi számítógépeken, így laptopokon, asztali gépeken és munkaállomásokon vizsgálja, hogy a helyben futtatott AI-munkafolyamatokat milyen hatékonyan kezelik az eszközök.
Az új kiadás egyik fontos eleme a képgenerálási kategória. Ez a terület a generatív vizuális képességek értékelését teszi lehetővé, kísérleti tesztként pedig a Flux.2 klein 4B szerepel benne.
Megjelent az ügynöki AI-kategória is. A mérés két forgatókönyvet tartalmaz: a szoftverfejlesztési ügynököt, vagyis SWE Agentet, valamint az adatelemző ügynököt, azaz Data Analyst Agentet. A teszt a teljes, végpontok közötti teljesítményt jelenti, és külön bontásban mutatja a nyelvi modell következtetési idejét, valamint az eszközök végrehajtásához szükséges időt.
Frissült a nyelvi modellek tesztelése
Az MLPerf Client v2.0 megtartja a korábbi, valós feladatokra épülő nyelvimodell-méréseket is. Ezek között szerepel az összefoglalás, a tartalomkészítés és a kódelemzés. A benchmark a válaszadási időről és az áteresztőképességről is közöl mérőszámokat.
A kötelező munkaterhelésekben a Phi 3.5 mini instruct modellt a Phi 4 Mini Instruct váltja. Kísérleti tesztként bekerült a Qwen 3 8B is. Az alapfeladatok között megjelent egy középhaladó összefoglalási feladat, amely nagyjából 4K tokenes bemeneti utasítást használ.
Az MLCommons szerint ezek a módosítások egy átfogó, több platformon használható kliensoldali AI-benchmark kialakítását szolgálják. A tesztcsomag célja, hogy a számítógépeken helyben futó különböző AI-képességek összehasonlítható mérését támogassa.
Nyílt forráskóddal érhető el
Az MLPerf Client fejlesztésében több technológiai vállalat és számítógépgyártó vesz részt. A közreműködők között az AMD, az Intel, a Microsoft, az NVIDIA és a Qualcomm Technologies szerepel, mellettük pedig vezető PC-gyártók is hozzájárultak a benchmark létrehozásához erőforrásokkal és szakértelemmel.
Az MLPerf Client v2.0 ingyenesen letölthető. A forráskód az MLCommons GitHub-tárházában ellenőrizhető, és a közösség hozzájárulhat a fejlesztéshez. A kiadások Windows, macOS és Linux rendszerhez is elérhetők.
A felhasználók és a számítógépgyártók így egyaránt olyan mérési keretrendszert kapnak, amely a nyelvi modellek mellett a képgenerálást és az ügynöki munkafolyamatokat is lefedi. A bővítés az MLCommons szerint közelebb viheti a kliensoldali AI-rendszerek teljesítményének egységesebb összevetését.


