Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az adatszennyezés akár 45 ponttal is felpumpálhatja az AI-benchmarkokat

2026. október 6.Forrás: Aleph Alpha
Az adatszennyezés akár 45 ponttal is felpumpálhatja az AI-benchmarkokat
Kép: Aleph Alpha

A benchmarkokból származó szövegek jelenléte a tanítási adatokban jelentősen torzíthatja a nyelvi modellek teljesítménymérését. Az Aleph Alpha vizsgálatában a kiszűrt dokumentumok visszahelyezése egy próbakísérletben 45 ponttal növelte a HumanEval, 28 ponttal pedig az MMLU eredményét.

A lényeg röviden
  • Az Aleph Alpha 8,3 milliárd dokumentumot vizsgált át benchmarkegyezések után.
  • 1,5 millió dokumentumot távolítottak el a középső tanítási adatokból.
  • A visszahelyezett adatok 45 ponttal növelték a HumanEval eredményét.
  • Az MMLU pontszáma ugyanebben a próbakísérletben 28 ponttal emelkedett.
  • Az előtanításból származó memorizálás a tisztított mid-training után is megmaradhatott.

A magas pontszám nem feltétlenül jelent jobb általánosítást

Az Aleph Alpha 2026. október 6-án közzétett kutatása arra hívja fel a figyelmet, hogy egy modell benchmarkeredménye akkor értelmezhető a képességek becsléseként, ha a rendszer a tesztpéldákat korábban nem látta. Ha a kérdések vagy a válaszok bekerülnek a tanítási adatokba, a pontszám a kutatók szerint részben vagy egészben memorizálást tükrözhet.

A benchmarkok kis mintát jelentenek egy jóval nagyobb problématérből. A GSM8K tesztkészletének 1319 kérdése például az általános iskolai matematika egészét hivatott reprezentálni. Ha egy modell már találkozott ezzel a mintával, a teszten elért jobb eredmény önmagában nem bizonyítja, hogy az új, hasonló feladatokat is jobban oldja meg.

Az Aleph Alpha olyan korábbi eredményeket is idéz, amelyek ezt a különbséget mutatják. A Scale AI kutatói által létrehozott GSM1k új, a GSM8K-hoz hasonló nehézségű és stílusú feladatsort kínált. Egyes modellek ezen akár 8 százalékponttal rosszabbul teljesítettek, mint az eredeti benchmarkon. A LiveCodeBench pedig azt mérte, hogy a DeepSeek-Instruct és a GPT-4o gyengébben szerepelt a megjelenésük és tudásbázisuk lezárási dátuma után közzétett LeetCode-feladatokon.

8,3 milliárd dokumentumot vizsgáltak át

A Kolibri középső tanítási szakasza előtt az Aleph Alpha a teljes, 8,3 milliárd dokumentumból álló mid-training adathalmazt összevetette a saját értékelési rendszerének minden benchmarkjával. Ennek során 1,5 millió olyan dokumentumot távolítottak el, amely egy benchmark valamely tételét csaknem szó szerint idézte.

A kiszűrt szövegek jelentős része benchmarkokhoz készült gyakorlófeladatokat tartalmazott, nem feltétlenül az adott tesztkészlet konkrét tesztpéldáit. Amikor a kutatók egy proxyfuttatásban visszatették ezeket a dokumentumokat, a HumanEval eredménye 45 ponttal, az MMLU pontszáma pedig 28 ponttal emelkedett. A növekedés azokra a kérdésekre is kiterjedt, amelyeknél nem találtak közvetlen adatszivárgást.

A referenciaállomány a vizsgálat idején 226 feladatot és 6,1 millió példányt tartalmazott, a tanító-, validációs és tesztfelosztásokkal együtt. A felsorolt benchmarkok között szerepelt az MMLU, az MMLU-Pro, az ARC, a HellaSwag, a TriviaQA, a GSM8K, a MATH, a HumanEval, az MBPP és a SQuAD, valamint ezek német változatai. A 226 feladatból 64 német volt.

A szűrő a közvetlen másolatokra érzékeny

Az Aleph Alpha az AI2 OLMo 3 mid-traininghez kiadott decon algoritmusát építette be saját adatválogatási folyamatába. A rendszer a benchmarkkérdéseket 5 szavas, a válaszokat 3 szavas n-gramokra bontja, majd a ritka kifejezéseknek nagyobb súlyt ad. A minden példában ismétlődő sablonszövegek így nulla súlyt kapnak, a jellegzetes fordulatok pedig nagyobbat.

A vizsgált dokumentum akkor került a törlendő elemek közé, ha valamely benchmarkpéldánnyal legalább 0,8-as egyezési pontszámot ért el. A pontszám 75 százalékban a kérdés súlyozott n-gramjaira, 25 százalékban pedig arra támaszkodott, hogy a válasz a kérdés közelében szerepel-e. Az 50 tokennél rövidebb példányoknál szigorúbb küszöböt alkalmaztak, 20 tokennél pedig teljes egyezést írtak elő.

A megoldásnak azonban korlátai vannak. A detektor a kiszivárgott MMLU-kérdések legfeljebb 60 százalékát, a TriviaQA kiszivárgott kérdéseinek pedig 13 százalékát sorolta a küszöb fölé. A többi dokumentumot azért távolították el, mert ugyanabban a fájlban szerepeltek. Az Aleph Alpha szerint a folyamat a középső tanítási adatokban működött, de vakfoltot is feltárt.

A korábbi tanítási adatok hatása később is visszatérhet

A középső tanítási szakasz adatszennyezésének eltávolítása önmagában nem bizonyult elegendőnek. Az Aleph Alpha nem tisztította meg ugyanígy az előtanítási adatokat, és az ott rögzült memorizálás a megtisztított mid-training adatokon keresztül ismét megjelent. A modell továbbra is fel tudta idézni azokat a HumanEval-megoldásokat, amelyeket korábban tanult meg.

A kutatás szerint ez a modellfejlesztés gyakorlati döntéseit is érintheti. Az adatkeverékeket a fejlesztők benchmarkpontszámok összehasonlításával választják ki, ezért egy adatszennyezés miatt felpumpált eredmény félrevezetheti az adatválogatást. Az Aleph Alpha azt is kiemeli, hogy a feladatlista folyamatosan változik: amikor új benchmark kerül az értékelési rendszerbe, a teljes adatmedencét ismét át kell vizsgálni.

A vállalat által idézett felmérés szerint a vizsgált 30 fejlesztőből csak 9 számol be a tanító- és tesztadatok átfedésének ellenőrzéséről. A benchmarkok megbízhatóságához ezért nem elég közölni a végső pontszámot. A tanítási adatok átvizsgálásának módja, az eltávolított dokumentumok és a szűrés korlátai is fontos részét képezik az eredmény értelmezésének.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Kolibrit mutatott be az Aleph Alpha német nyelvű AI-feladatokra
Modellek2026. október 5.

Kolibrit mutatott be az Aleph Alpha német nyelvű AI-feladatokra

Az Aleph Alpha kiadta a Kolibrit, egy német és angol nyelvet támogató nagy nyelvi modellt, amelyet kritikus fontosságú közigazgatási és ipari alkalmazásokhoz…

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt
Modellek2026. október 3.

Az Aleph Alpha bemutatta a Kolibri nevű, nyílt súlyú AI-modellt

Az Aleph Alpha bemutatta a Kolibrit, egy német és angol nyelvre fejlesztett, nyílt súlyú Mixture-of-Experts modellt. A 78 milliárd teljes és 3 milliárd aktív…

Az Aleph Alpha 512 B200 GPU-n skálázta 30 milliárd paraméteres modelljét
Kutatás2026. szeptember 30.

Az Aleph Alpha 512 B200 GPU-n skálázta 30 milliárd paraméteres modelljét

Az Aleph Alpha 16-ról 512 NVIDIA B200 GPU-ra növelte egy 30B-A3B MoE modell előtanításának számítási kapacitását. A vállalat szerint a hierarchikus módszerrel 35,3…