MLCommons

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél
Az MLCommons közzétette az AI-ügynökök adatvédelmi kockázatainak első taxonómiáját. A dokumentum öt fő területet különít el, a begyűjtött adatok kezelésétől az…

DLRMv4: új MLPerf Training benchmark a sorozatalapú ajánlórendszerekhez
Az MLCommons bemutatta a DLRMv4-et, az MLPerf Training ajánlórendszerekhez készült új benchmarkját. A mérés a hagyományos jellemző-interakciós felépítés helyett a…

Az MLCommons új ajánlási benchmarkot mutatott be, 560 GB-os embeddingtáblával
Az MLCommons bemutatta a DLRMv4-et, az MLPerf Training ajánlórendszerekhez készült új benchmarkját. A mérés a felhasználók eseménysorozatait közvetlenül feldolgozó…

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét
Az MLPerf Training első alkalommal külön benchmarkkal méri a nagy nyelvi modellek utótréningjét. A teszt a Qwen 3.5 397B modellt szoftverfejlesztési feladatokon…

Az MLCommons az AIRIS projektben méri majd az orvosi AI megbízhatóságát
Az MLCommons csatlakozott az uniós finanszírozású AIRIS kutatási projekthez, amely biológiai ismereteket és klinikai adatokat integráló generatív AI-modelleket fejleszt.…

Rekordszámú résztvevővel érkezett az MLPerf Inference v6.1
Az MLPerf Inference v6.1 minden korábbinál szélesebb mezőnyt hozott, 30 szervezet összesen 120 rendszert nevezett. A szeptember 17-i elemzés szerint a fordulóban az…

Rekordszámú résztvevővel érkezett az MLPerf Inference v6.1
Az MLCommons közzétette az MLPerf Inference v6.1 eredményeit, amelyekben rekordszámú, 30 szervezet vett részt. A kiadás két új tesztet vezetett be, és egyes feladatokban…

Döntős lett az MLCommons pénzügyi AI-ügynökökre kidolgozott profilja
Döntőbe jutott az MLCommons Financial Services Working Group Agent Reliability Profile kezdeményezése a C:>DIR Global „Agentic Regulator” Hackathonon. A projekt azt…
Chipek és infrastruktúraMegjelent az MLPerf Storage v3.0, már S3-t is mér
Az MLCommons közzétette az MLPerf Storage v3.0 benchmark eredményeit, amelyek az AI-munkafolyamatokhoz használt tárolórendszerek teljesítményét mérik. Az új kiadás két…

Titkosítással védené az AI-tesztek és modellek integritását az MLCommons
Első alkalommal teszteltek kettős vak módszerrel zárt súlyú AI-modellt úgy, hogy a folyamatban részt vevő felek ne férjenek hozzá egymás érzékeny adataihoz. Az MLCommons…
Biztonság és etikaKettős vak AI-értékelést indít a Google DeepMind külső partnerekkel
A Google DeepMind 2026. augusztus 27-én bejelentette, hogy elindítja a világ első kettős vak értékelését egy saját, frontier kategóriájú AI-modellen. A pilotban a…
KutatásAz MLPerf új benchmarkja teljes RAG-rendszereket mér
Az MLCommons bemutatta az első, végponttól végpontig terjedő MLPerf RAG-benchmarkot. A mérés egy teljes, több modellből álló folyamatot vizsgál, a dokumentumok…
FejlesztőknekKépgenerálással és ügynöki feladatokkal bővült az MLPerf Client
Az MLCommons kiadta az MLPerf Client v2.0-t, amely a személyi számítógépeken futó mesterséges intelligencia teljesítményét méri. Az új verzió a nyelvi modellek mellett…