Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Képgenerálással és ügynöki feladatokkal bővült az MLPerf Client

2026. augusztus 18.Forrás: MLCommons

Az MLCommons kiadta az MLPerf Client v2.0-t, amely a személyi számítógépeken futó mesterséges intelligencia teljesítményét méri. Az új verzió a nyelvi modellek mellett képgenerálási és ügynöki AI-feladatokkal bővíti a teszteket.

A lényeg röviden
  • Megjelent az MLPerf Client v2.0 új verziója.
  • A benchmark képgenerálási kategóriával bővült, benne a Flux.2 klein 4B kísérleti tesztjével.
  • Az ügynöki AI-mérés SWE Agent és Data Analyst Agent forgatókönyveket tartalmaz.
  • A Phi 3.5 mini instruct helyét a Phi 4 Mini Instruct vette át a kötelező tesztekben.
  • A szoftver ingyenesen letölthető, forráskódja az MLCommons GitHub-tárházában elérhető.

Két új területtel bővült a mérés

Az MLCommons 2026. augusztus 18-án jelentette be az MLPerf Client v2.0 megjelenését. A benchmark személyi számítógépeken, így laptopokon, asztali gépeken és munkaállomásokon vizsgálja, hogy a helyben futtatott AI-munkafolyamatokat milyen hatékonyan kezelik az eszközök.

Az új kiadás egyik fontos eleme a képgenerálási kategória. Ez a terület a generatív vizuális képességek értékelését teszi lehetővé, kísérleti tesztként pedig a Flux.2 klein 4B szerepel benne.

Megjelent az ügynöki AI-kategória is. A mérés két forgatókönyvet tartalmaz: a szoftverfejlesztési ügynököt, vagyis SWE Agentet, valamint az adatelemző ügynököt, azaz Data Analyst Agentet. A teszt a teljes, végpontok közötti teljesítményt jelenti, és külön bontásban mutatja a nyelvi modell következtetési idejét, valamint az eszközök végrehajtásához szükséges időt.

Frissült a nyelvi modellek tesztelése

Az MLPerf Client v2.0 megtartja a korábbi, valós feladatokra épülő nyelvimodell-méréseket is. Ezek között szerepel az összefoglalás, a tartalomkészítés és a kódelemzés. A benchmark a válaszadási időről és az áteresztőképességről is közöl mérőszámokat.

A kötelező munkaterhelésekben a Phi 3.5 mini instruct modellt a Phi 4 Mini Instruct váltja. Kísérleti tesztként bekerült a Qwen 3 8B is. Az alapfeladatok között megjelent egy középhaladó összefoglalási feladat, amely nagyjából 4K tokenes bemeneti utasítást használ.

Az MLCommons szerint ezek a módosítások egy átfogó, több platformon használható kliensoldali AI-benchmark kialakítását szolgálják. A tesztcsomag célja, hogy a számítógépeken helyben futó különböző AI-képességek összehasonlítható mérését támogassa.

Nyílt forráskóddal érhető el

Az MLPerf Client fejlesztésében több technológiai vállalat és számítógépgyártó vesz részt. A közreműködők között az AMD, az Intel, a Microsoft, az NVIDIA és a Qualcomm Technologies szerepel, mellettük pedig vezető PC-gyártók is hozzájárultak a benchmark létrehozásához erőforrásokkal és szakértelemmel.

Az MLPerf Client v2.0 ingyenesen letölthető. A forráskód az MLCommons GitHub-tárházában ellenőrizhető, és a közösség hozzájárulhat a fejlesztéshez. A kiadások Windows, macOS és Linux rendszerhez is elérhetők.

A felhasználók és a számítógépgyártók így egyaránt olyan mérési keretrendszert kapnak, amely a nyelvi modellek mellett a képgenerálást és az ügynöki munkafolyamatokat is lefedi. A bővítés az MLCommons szerint közelebb viheti a kliensoldali AI-rendszerek teljesítményének egységesebb összevetését.

Kapcsolódó hírek

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott
Kutatás2026. október 3.

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott

A Hugging Face oldalának címe szerint egy ügynök késznek jelentett egy feladatot, az adatbázis azonban ellentmondott ennek. A megadott forrásrészlet a történet részletes…

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél
Biztonság és etika2026. október 1.

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél

Az MLCommons közzétette az AI-ügynökök adatvédelmi kockázatainak első taxonómiáját. A dokumentum öt fő területet különít el, a begyűjtött adatok kezelésétől az…

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét
Kutatás2026. szeptember 24.

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét

Az MLPerf Training első alkalommal külön benchmarkkal méri a nagy nyelvi modellek utótréningjét. A teszt a Qwen 3.5 397B modellt szoftverfejlesztési feladatokon…