Az UK AISI nyilvánosabbá teszi az MI-modellek teszteredményeit

Az Egyesült Királyság AI Security Institute-ja az EvalEval infrastruktúráját használja az MI-modellek értékelési eredményeinek nyilvános megosztására. A kezdeményezés célja, hogy a benchmarkok eredményei könnyebben ellenőrizhetők és reprodukálhatók legyenek.
- Az UK AISI az EvalEval infrastruktúráján teszi közzé értékelési eredményeit.
- Az adatok öt benchmark és hat frontier modell eredményeit tartalmazzák.
- A Humanity’s Last Exam eredményei a tesztelési protokolltól és a következtetési számítástól is függtek.
- Az Evaluation Cards az eredmények mellett konfigurációs és módszertani adatokat is megjelenít.
- Az EvalEval az EEE séma szélesebb körű használatát sürgeti.
Közös rendszerben teszik közzé az eredményeket
Az EvalEval Coalition szeptember 22-i bejelentése szerint az UK AI Security Institute, röviden AISI, az EvalEval infrastruktúráján keresztül osztja meg az értékelések eredményeit. A szervezetek korábban is együttműködtek: közös kutatásuk a NeurIPS 2025 konferencia mellett tartott workshopon indult, az AISI visszajelzései pedig hozzájárultak az Every Eval Ever, vagyis az EEE séma kialakításához.
Az EEE egy közös jelentési séma, az Evaluation Cards pedig olyan nyílt platform, amely egységes szerkezetben kapcsolja össze az értékelési eredményeket, a benchmarkok adatait, a futtatások részleteit és a modellekre vonatkozó információkat.
Öt benchmark, hat frontier modell
Az AISI a nyilvánosan közölt módszereket és eredményeket megfelelő esetben Evaluation Cards formájában teszi elérhetővé. A mostani kiadás a tanulmány fő kísérletében szereplő öt benchmark ellenőrzött eredményeit, valamint a hozzájuk tartozó kontextust és konfigurációs információkat tartalmazza.
- HealthBench
- FrontierMath
- Humanity’s Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Az adatok hat élvonalbeli modellre terjednek ki: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 és GPT-5.4. A csomag két kapcsolódó kiberbiztonsági értékelés, a Cyber CTFs és a The Last Ones eredményeit is tartalmazza. Ezeknél eltérő, részben átfedő modellkészletet használtak.
A tesztelési beállítások is megváltoztathatják a pontszámot
Az eredmények az AISI How Inference Compute Shapes Frontier LLM Evaluation című tanulmányát kísérik. A kutatás azt vizsgálja, hogyan függ a benchmarkok teljesítménye a következtetési fázisban felhasznált számítási kapacitástól és az értékelési protokolltól.
A Humanity’s Last Exam esetében a teljesítmény az alkalmazott protokoll és a következtetéshez engedélyezett számítás változásával együtt módosult. A grafikonok azt mutatják, hogy a modellek az egyes feladatokat mekkora tokenszám felhasználásáig oldották meg, az adott feladathoz megfigyelt legkorábbi siker alapján. Amikor minden próbálkozás után egy ellenőrző rendszer visszajelzést adott a helyességről, a modellek a tokenszám növekedésével további feladatokat oldottak meg.
Az EvalEval szerint ez azért fontos, mert az értékelések eredményeit gyakran eltérő formátumokban és platformokon közlik, sokszor a reprodukcióhoz szükséges információk nélkül. Egy teszt újbóli lefuttatása ráadásul megfizethetetlenül drága is lehet. A konfigurációs és módszertani adatok közzététele lehetővé teszi, hogy a kutatók és a gyakorlati szakemberek részletesebben vizsgálják az egyes eredményeket, és figyelembe vegyék, miként befolyásolhatják a beállítások a jelentett teljesítményt.
Az EvalEval szélesebb körű alkalmazást vár
Az EvalEval Coalition célja az értékelési tudomány fejlesztése, az értékelések dokumentálásával és használhatóságával kapcsolatos konszenzus hiányának kezelése, valamint a tudományos kutatás és a szakpolitikai elemzés szempontjából fontos hatások lefedettségének bővítése.
A koalíció arra kéri a modellfejlesztőket, hogy ellenőrzött értékelési eredményeket jelentsenek, az értékelések fejlesztőit pedig arra, hogy benchmarkokat és futtatási adatokat közöljenek az EEE séma szerint. Az értékelési, kormányzási és szakpolitikai kutatók az Evaluation Cards felületén benchmark vagy modell alapján vizsgálhatják az adatokat, illetve az értékelési jelentések állapotát is elemezhetik.
Az UK AISI szerintük a brit Tudományos, Innovációs és Technológiai Minisztériumon belül működő kutatási szervezet. Küldetése, hogy tudományos alapú ismeretekkel segítse a kormányokat a fejlett MI jelentette kockázatok megértésében. Az EvalEval és az AISI együttműködése a részletesebb, összevethetőbb és ellenőrizhetőbb értékelési eredmények felé tereli a modelltesztelést.
Hugging Face: How UK AISI and EvalEval Are Making Benchmark Results Reproducible


