Az MLPerf új benchmarkja teljes RAG-rendszereket mér
Az MLCommons bemutatta az első, végponttól végpontig terjedő MLPerf RAG-benchmarkot. A mérés egy teljes, több modellből álló folyamatot vizsgál, a dokumentumok vektorizálásától a több lépésben felépített válaszok generálásáig.
- Az MLCommons bemutatta az első végponttól végpontig terjedő MLPerf RAG-benchmarkot.
- A mérés a vektordatabázis létrehozását és a kérdés-válasz folyamatot is lefedi.
- A feladat 824, több lépéses kérdésre épül 2515 Wikipedia-cikk alapján.
- A referenciafolyamat többek között GPT-OSS, ColBERTv2.0 és Llama-3.1-8B modelleket használ.
- A benchmark többmodellű RAG-rendszerek optimalizációs lehetőségeit is vizsgálja.
A teljes RAG-folyamatot teszteli
Az MLCommons MLPerf Inference munkacsoportja 2026. augusztus 26-án ismertette az új benchmarkot. A Retrieval-Augmented Generation, vagyis RAG olyan megközelítés, amely a modell saját paraméterei mellett a lekérdezés pillanatában visszakeresett dokumentumokra is támaszkodik.
Ez segíthet csökkenteni a hallucinációkat, naprakész információkat használhat, és lehetővé teszi, hogy egy általános modell olyan belső vagy védett tudásból dolgozzon, amelyre nem tanították. Az MLCommons szerint a gyakorlatban egy RAG-rendszer ritkán egyetlen modellből áll. Több, eltérő feladatú modell dolgozik együtt a releváns dokumentumok megkeresésén, értékelésén és a megalapozott válasz elkészítésén.
Az új benchmark ezt a teljes láncot méri. Két munkafolyamatból áll: az e2e-rag-db létrehozza a vektordatabázist, az e2e-rag-qna pedig pontozott, végponttól végpontig tartó kérdés-válasz folyamatként működik.
Wikipedia-adatokon, több lépésben keres válaszokat
A feladat a FRAMES benchmarkra épül. A rendszernek 824 kérdésre kell válaszolnia, amelyekhez helyes válasz és a szükséges Wikipedia-cikkek URL-je is rendelkezésre áll. A korpusz 2515 Wikipedia HTML-cikket tartalmaz, ezekből körülbelül 107 000, egyenként 768 karakteres, 32 karakteres átfedéssel létrehozott szövegrész készül.
A kérdések több lépést, úgynevezett multi-hop következtetést igényelnek. Ilyenkor a válaszhoz szükséges tények nem szerepelnek egyetlen szövegrészben, ezért a rendszernek egymás után kell keresnie, ellenőriznie és összekapcsolnia az információkat. A forrás példája szerint egy kérdésből három különálló tény összekapcsolásával vezethető le a helyes válasz, amely Hans Asperger.
Az adatbázis felépítésekor a rendszer kinyeri a cikkek törzsét, eltávolítja a Wikipédiára jellemző metaadatokat és navigációs elemeket, majd a szöveget részekre bontja. A szövegrészekből 768 dimenziós vektorok készülnek, amelyeket FAISS HNSW-gráfban indexelnek a hasonlóságon alapuló kereséshez.
Több modell dolgozik egyetlen válaszon
A kérdés-válasz folyamat egy kérdésátíróval kezdődik, amely legfeljebb három célzott alkérdésre bontja a bevitelt. Ezeket a rendszer beágyazza, majd releváns szövegrészeket keres az adatbázisban. Az újrarangsoroló kiszűri a duplikátumokat és sorrendbe állítja a jelölteket, a dokumentumosztályozó pedig eldönti, mely részek segítik ténylegesen a választ.
Egy elégségesség-ellenőrző azt vizsgálja, hogy az összegyűjtött bizonyíték már elegendő-e. Ha nem, a rendszer új alkérdéseket készít, és a keresést legfeljebb öt lépésen keresztül folytatja. A végén a válaszgeneráló a megtartott szövegrészekre támaszkodó választ ad, vagy az Unknown eredményt küldi vissza, ha nincs elég bizonyíték.
A referencia-összeállításban az embedding feladatát az intfloat/e5-base-v2, az újrarangsorolást a ColBERTv2.0 végzi. A lekérdezés átírását, a bizonyíték elégségességének ellenőrzését és a végső válasz létrehozását a GPT-OSS-120B, a dokumentumok értékelését a GPT-OSS-20B látja el. A bírói feladatot a Llama-3.1-8B kapta. Az MLCommons közlése szerint ezek a modellek letölthetők az MLCommons-Storage tárhelyéről.
A benchmark a rendszer szintű optimalizációt is láthatóvá teszi
Az MLCommons szerint az egyetlen modellt egyetlen prompton vizsgáló tesztek nem mutatják meg, hogyan teljesít egy valós RAG-telepítés. Az új mérés lehetőséget ad többek között a modellek különböző gyorsítókra helyezésének, az egy eszközön való együttfutásnak, a több lépcsőből álló hívások ütemezésének és a prefixek gyorsítótárazásának vizsgálatára.
A közlemény az új benchmarkot az ügynöki mesterséges intelligencia mérésének egyik előzményeként is bemutatja. A RAG az ügynökök egyik használható eszköze, ezért a több modellből és több komponensből álló működés vizsgálata alapot adhat későbbi, ügynöki rendszereket mérő benchmarkokhoz.
MLCommons: Introducing the MLPerf End-to-End RAG Inference Benchmark


