Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az MLPerf új benchmarkja teljes RAG-rendszereket mér

2026. augusztus 26. 16:50Forrás: MLCommons

Az MLCommons bemutatta az első, végponttól végpontig terjedő MLPerf RAG-benchmarkot. A mérés egy teljes, több modellből álló folyamatot vizsgál, a dokumentumok vektorizálásától a több lépésben felépített válaszok generálásáig.

A lényeg röviden
  • Az MLCommons bemutatta az első végponttól végpontig terjedő MLPerf RAG-benchmarkot.
  • A mérés a vektordatabázis létrehozását és a kérdés-válasz folyamatot is lefedi.
  • A feladat 824, több lépéses kérdésre épül 2515 Wikipedia-cikk alapján.
  • A referenciafolyamat többek között GPT-OSS, ColBERTv2.0 és Llama-3.1-8B modelleket használ.
  • A benchmark többmodellű RAG-rendszerek optimalizációs lehetőségeit is vizsgálja.

A teljes RAG-folyamatot teszteli

Az MLCommons MLPerf Inference munkacsoportja 2026. augusztus 26-án ismertette az új benchmarkot. A Retrieval-Augmented Generation, vagyis RAG olyan megközelítés, amely a modell saját paraméterei mellett a lekérdezés pillanatában visszakeresett dokumentumokra is támaszkodik.

Ez segíthet csökkenteni a hallucinációkat, naprakész információkat használhat, és lehetővé teszi, hogy egy általános modell olyan belső vagy védett tudásból dolgozzon, amelyre nem tanították. Az MLCommons szerint a gyakorlatban egy RAG-rendszer ritkán egyetlen modellből áll. Több, eltérő feladatú modell dolgozik együtt a releváns dokumentumok megkeresésén, értékelésén és a megalapozott válasz elkészítésén.

Az új benchmark ezt a teljes láncot méri. Két munkafolyamatból áll: az e2e-rag-db létrehozza a vektordatabázist, az e2e-rag-qna pedig pontozott, végponttól végpontig tartó kérdés-válasz folyamatként működik.

Wikipedia-adatokon, több lépésben keres válaszokat

A feladat a FRAMES benchmarkra épül. A rendszernek 824 kérdésre kell válaszolnia, amelyekhez helyes válasz és a szükséges Wikipedia-cikkek URL-je is rendelkezésre áll. A korpusz 2515 Wikipedia HTML-cikket tartalmaz, ezekből körülbelül 107 000, egyenként 768 karakteres, 32 karakteres átfedéssel létrehozott szövegrész készül.

A kérdések több lépést, úgynevezett multi-hop következtetést igényelnek. Ilyenkor a válaszhoz szükséges tények nem szerepelnek egyetlen szövegrészben, ezért a rendszernek egymás után kell keresnie, ellenőriznie és összekapcsolnia az információkat. A forrás példája szerint egy kérdésből három különálló tény összekapcsolásával vezethető le a helyes válasz, amely Hans Asperger.

Az adatbázis felépítésekor a rendszer kinyeri a cikkek törzsét, eltávolítja a Wikipédiára jellemző metaadatokat és navigációs elemeket, majd a szöveget részekre bontja. A szövegrészekből 768 dimenziós vektorok készülnek, amelyeket FAISS HNSW-gráfban indexelnek a hasonlóságon alapuló kereséshez.

Több modell dolgozik egyetlen válaszon

A kérdés-válasz folyamat egy kérdésátíróval kezdődik, amely legfeljebb három célzott alkérdésre bontja a bevitelt. Ezeket a rendszer beágyazza, majd releváns szövegrészeket keres az adatbázisban. Az újrarangsoroló kiszűri a duplikátumokat és sorrendbe állítja a jelölteket, a dokumentumosztályozó pedig eldönti, mely részek segítik ténylegesen a választ.

Egy elégségesség-ellenőrző azt vizsgálja, hogy az összegyűjtött bizonyíték már elegendő-e. Ha nem, a rendszer új alkérdéseket készít, és a keresést legfeljebb öt lépésen keresztül folytatja. A végén a válaszgeneráló a megtartott szövegrészekre támaszkodó választ ad, vagy az Unknown eredményt küldi vissza, ha nincs elég bizonyíték.

A referencia-összeállításban az embedding feladatát az intfloat/e5-base-v2, az újrarangsorolást a ColBERTv2.0 végzi. A lekérdezés átírását, a bizonyíték elégségességének ellenőrzését és a végső válasz létrehozását a GPT-OSS-120B, a dokumentumok értékelését a GPT-OSS-20B látja el. A bírói feladatot a Llama-3.1-8B kapta. Az MLCommons közlése szerint ezek a modellek letölthetők az MLCommons-Storage tárhelyéről.

A benchmark a rendszer szintű optimalizációt is láthatóvá teszi

Az MLCommons szerint az egyetlen modellt egyetlen prompton vizsgáló tesztek nem mutatják meg, hogyan teljesít egy valós RAG-telepítés. Az új mérés lehetőséget ad többek között a modellek különböző gyorsítókra helyezésének, az egy eszközön való együttfutásnak, a több lépcsőből álló hívások ütemezésének és a prefixek gyorsítótárazásának vizsgálatára.

A közlemény az új benchmarkot az ügynöki mesterséges intelligencia mérésének egyik előzményeként is bemutatja. A RAG az ügynökök egyik használható eszköze, ezért a több modellből és több komponensből álló működés vizsgálata alapot adhat későbbi, ügynöki rendszereket mérő benchmarkokhoz.

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél
Biztonság és etika2026. október 1. 20:01

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél

Az MLCommons közzétette az AI-ügynökök adatvédelmi kockázatainak első taxonómiáját. A dokumentum öt fő területet különít el, a begyűjtött adatok kezelésétől az…

DLRMv4: új MLPerf Training benchmark a sorozatalapú ajánlórendszerekhez
Kutatás2026. október 1. 16:50

DLRMv4: új MLPerf Training benchmark a sorozatalapú ajánlórendszerekhez

Az MLCommons bemutatta a DLRMv4-et, az MLPerf Training ajánlórendszerekhez készült új benchmarkját. A mérés a hagyományos jellemző-interakciós felépítés helyett a…