Az adatszennyezés akár 45 ponttal is felpumpálhatja az AI-benchmarkokat

A benchmarkokból származó szövegek jelenléte a tanítási adatokban jelentősen torzíthatja a nyelvi modellek teljesítménymérését. Az Aleph Alpha vizsgálatában a kiszűrt dokumentumok visszahelyezése egy próbakísérletben 45 ponttal növelte a HumanEval, 28 ponttal pedig az MMLU eredményét.
- Az Aleph Alpha 8,3 milliárd dokumentumot vizsgált át benchmarkegyezések után.
- 1,5 millió dokumentumot távolítottak el a középső tanítási adatokból.
- A visszahelyezett adatok 45 ponttal növelték a HumanEval eredményét.
- Az MMLU pontszáma ugyanebben a próbakísérletben 28 ponttal emelkedett.
- Az előtanításból származó memorizálás a tisztított mid-training után is megmaradhatott.
A magas pontszám nem feltétlenül jelent jobb általánosítást
Az Aleph Alpha 2026. október 6-án közzétett kutatása arra hívja fel a figyelmet, hogy egy modell benchmarkeredménye akkor értelmezhető a képességek becsléseként, ha a rendszer a tesztpéldákat korábban nem látta. Ha a kérdések vagy a válaszok bekerülnek a tanítási adatokba, a pontszám a kutatók szerint részben vagy egészben memorizálást tükrözhet.
A benchmarkok kis mintát jelentenek egy jóval nagyobb problématérből. A GSM8K tesztkészletének 1319 kérdése például az általános iskolai matematika egészét hivatott reprezentálni. Ha egy modell már találkozott ezzel a mintával, a teszten elért jobb eredmény önmagában nem bizonyítja, hogy az új, hasonló feladatokat is jobban oldja meg.
Az Aleph Alpha olyan korábbi eredményeket is idéz, amelyek ezt a különbséget mutatják. A Scale AI kutatói által létrehozott GSM1k új, a GSM8K-hoz hasonló nehézségű és stílusú feladatsort kínált. Egyes modellek ezen akár 8 százalékponttal rosszabbul teljesítettek, mint az eredeti benchmarkon. A LiveCodeBench pedig azt mérte, hogy a DeepSeek-Instruct és a GPT-4o gyengébben szerepelt a megjelenésük és tudásbázisuk lezárási dátuma után közzétett LeetCode-feladatokon.
8,3 milliárd dokumentumot vizsgáltak át
A Kolibri középső tanítási szakasza előtt az Aleph Alpha a teljes, 8,3 milliárd dokumentumból álló mid-training adathalmazt összevetette a saját értékelési rendszerének minden benchmarkjával. Ennek során 1,5 millió olyan dokumentumot távolítottak el, amely egy benchmark valamely tételét csaknem szó szerint idézte.
A kiszűrt szövegek jelentős része benchmarkokhoz készült gyakorlófeladatokat tartalmazott, nem feltétlenül az adott tesztkészlet konkrét tesztpéldáit. Amikor a kutatók egy proxyfuttatásban visszatették ezeket a dokumentumokat, a HumanEval eredménye 45 ponttal, az MMLU pontszáma pedig 28 ponttal emelkedett. A növekedés azokra a kérdésekre is kiterjedt, amelyeknél nem találtak közvetlen adatszivárgást.
A referenciaállomány a vizsgálat idején 226 feladatot és 6,1 millió példányt tartalmazott, a tanító-, validációs és tesztfelosztásokkal együtt. A felsorolt benchmarkok között szerepelt az MMLU, az MMLU-Pro, az ARC, a HellaSwag, a TriviaQA, a GSM8K, a MATH, a HumanEval, az MBPP és a SQuAD, valamint ezek német változatai. A 226 feladatból 64 német volt.
A szűrő a közvetlen másolatokra érzékeny
Az Aleph Alpha az AI2 OLMo 3 mid-traininghez kiadott decon algoritmusát építette be saját adatválogatási folyamatába. A rendszer a benchmarkkérdéseket 5 szavas, a válaszokat 3 szavas n-gramokra bontja, majd a ritka kifejezéseknek nagyobb súlyt ad. A minden példában ismétlődő sablonszövegek így nulla súlyt kapnak, a jellegzetes fordulatok pedig nagyobbat.
A vizsgált dokumentum akkor került a törlendő elemek közé, ha valamely benchmarkpéldánnyal legalább 0,8-as egyezési pontszámot ért el. A pontszám 75 százalékban a kérdés súlyozott n-gramjaira, 25 százalékban pedig arra támaszkodott, hogy a válasz a kérdés közelében szerepel-e. Az 50 tokennél rövidebb példányoknál szigorúbb küszöböt alkalmaztak, 20 tokennél pedig teljes egyezést írtak elő.
A megoldásnak azonban korlátai vannak. A detektor a kiszivárgott MMLU-kérdések legfeljebb 60 százalékát, a TriviaQA kiszivárgott kérdéseinek pedig 13 százalékát sorolta a küszöb fölé. A többi dokumentumot azért távolították el, mert ugyanabban a fájlban szerepeltek. Az Aleph Alpha szerint a folyamat a középső tanítási adatokban működött, de vakfoltot is feltárt.
A korábbi tanítási adatok hatása később is visszatérhet
A középső tanítási szakasz adatszennyezésének eltávolítása önmagában nem bizonyult elegendőnek. Az Aleph Alpha nem tisztította meg ugyanígy az előtanítási adatokat, és az ott rögzült memorizálás a megtisztított mid-training adatokon keresztül ismét megjelent. A modell továbbra is fel tudta idézni azokat a HumanEval-megoldásokat, amelyeket korábban tanult meg.
A kutatás szerint ez a modellfejlesztés gyakorlati döntéseit is érintheti. Az adatkeverékeket a fejlesztők benchmarkpontszámok összehasonlításával választják ki, ezért egy adatszennyezés miatt felpumpált eredmény félrevezetheti az adatválogatást. Az Aleph Alpha azt is kiemeli, hogy a feladatlista folyamatosan változik: amikor új benchmark kerül az értékelési rendszerbe, a teljes adatmedencét ismét át kell vizsgálni.
A vállalat által idézett felmérés szerint a vizsgált 30 fejlesztőből csak 9 számol be a tanító- és tesztadatok átfedésének ellenőrzéséről. A benchmarkok megbízhatóságához ezért nem elég közölni a végső pontszámot. A tanítási adatok átvizsgálásának módja, az eltávolított dokumentumok és a szűrés korlátai is fontos részét képezik az eredmény értelmezésének.
Aleph Alpha: Generalization or Memorization? What Contaminated Training Data Does to Benchmark Scores — Aleph Alpha


