Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az UK AISI nyilvánosabbá teszi az MI-modellek teszteredményeit

2026. szeptember 22.Forrás: Hugging Face
Az UK AISI nyilvánosabbá teszi az MI-modellek teszteredményeit
Kép: Hugging Face

Az Egyesült Királyság AI Security Institute-ja az EvalEval infrastruktúráját használja az MI-modellek értékelési eredményeinek nyilvános megosztására. A kezdeményezés célja, hogy a benchmarkok eredményei könnyebben ellenőrizhetők és reprodukálhatók legyenek.

A lényeg röviden
  • Az UK AISI az EvalEval infrastruktúráján teszi közzé értékelési eredményeit.
  • Az adatok öt benchmark és hat frontier modell eredményeit tartalmazzák.
  • A Humanity’s Last Exam eredményei a tesztelési protokolltól és a következtetési számítástól is függtek.
  • Az Evaluation Cards az eredmények mellett konfigurációs és módszertani adatokat is megjelenít.
  • Az EvalEval az EEE séma szélesebb körű használatát sürgeti.

Közös rendszerben teszik közzé az eredményeket

Az EvalEval Coalition szeptember 22-i bejelentése szerint az UK AI Security Institute, röviden AISI, az EvalEval infrastruktúráján keresztül osztja meg az értékelések eredményeit. A szervezetek korábban is együttműködtek: közös kutatásuk a NeurIPS 2025 konferencia mellett tartott workshopon indult, az AISI visszajelzései pedig hozzájárultak az Every Eval Ever, vagyis az EEE séma kialakításához.

Az EEE egy közös jelentési séma, az Evaluation Cards pedig olyan nyílt platform, amely egységes szerkezetben kapcsolja össze az értékelési eredményeket, a benchmarkok adatait, a futtatások részleteit és a modellekre vonatkozó információkat.

Öt benchmark, hat frontier modell

Az AISI a nyilvánosan közölt módszereket és eredményeket megfelelő esetben Evaluation Cards formájában teszi elérhetővé. A mostani kiadás a tanulmány fő kísérletében szereplő öt benchmark ellenőrzött eredményeit, valamint a hozzájuk tartozó kontextust és konfigurációs információkat tartalmazza.

  • HealthBench
  • FrontierMath
  • Humanity’s Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Az adatok hat élvonalbeli modellre terjednek ki: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 és GPT-5.4. A csomag két kapcsolódó kiberbiztonsági értékelés, a Cyber CTFs és a The Last Ones eredményeit is tartalmazza. Ezeknél eltérő, részben átfedő modellkészletet használtak.

A tesztelési beállítások is megváltoztathatják a pontszámot

Az eredmények az AISI How Inference Compute Shapes Frontier LLM Evaluation című tanulmányát kísérik. A kutatás azt vizsgálja, hogyan függ a benchmarkok teljesítménye a következtetési fázisban felhasznált számítási kapacitástól és az értékelési protokolltól.

A Humanity’s Last Exam esetében a teljesítmény az alkalmazott protokoll és a következtetéshez engedélyezett számítás változásával együtt módosult. A grafikonok azt mutatják, hogy a modellek az egyes feladatokat mekkora tokenszám felhasználásáig oldották meg, az adott feladathoz megfigyelt legkorábbi siker alapján. Amikor minden próbálkozás után egy ellenőrző rendszer visszajelzést adott a helyességről, a modellek a tokenszám növekedésével további feladatokat oldottak meg.

Az EvalEval szerint ez azért fontos, mert az értékelések eredményeit gyakran eltérő formátumokban és platformokon közlik, sokszor a reprodukcióhoz szükséges információk nélkül. Egy teszt újbóli lefuttatása ráadásul megfizethetetlenül drága is lehet. A konfigurációs és módszertani adatok közzététele lehetővé teszi, hogy a kutatók és a gyakorlati szakemberek részletesebben vizsgálják az egyes eredményeket, és figyelembe vegyék, miként befolyásolhatják a beállítások a jelentett teljesítményt.

Az EvalEval szélesebb körű alkalmazást vár

Az EvalEval Coalition célja az értékelési tudomány fejlesztése, az értékelések dokumentálásával és használhatóságával kapcsolatos konszenzus hiányának kezelése, valamint a tudományos kutatás és a szakpolitikai elemzés szempontjából fontos hatások lefedettségének bővítése.

A koalíció arra kéri a modellfejlesztőket, hogy ellenőrzött értékelési eredményeket jelentsenek, az értékelések fejlesztőit pedig arra, hogy benchmarkokat és futtatási adatokat közöljenek az EEE séma szerint. Az értékelési, kormányzási és szakpolitikai kutatók az Evaluation Cards felületén benchmark vagy modell alapján vizsgálhatják az adatokat, illetve az értékelési jelentések állapotát is elemezhetik.

Az UK AISI szerintük a brit Tudományos, Innovációs és Technológiai Minisztériumon belül működő kutatási szervezet. Küldetése, hogy tudományos alapú ismeretekkel segítse a kormányokat a fejlett MI jelentette kockázatok megértésében. Az EvalEval és az AISI együttműködése a részletesebb, összevethetőbb és ellenőrizhetőbb értékelési eredmények felé tereli a modelltesztelést.

Kapcsolódó hírek

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt…

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a…

A gondolkodási láncok irányíthatóságát alul mérhetik a tesztek
Kutatás2026. szeptember 11.

A gondolkodási láncok irányíthatóságát alul mérhetik a tesztek

A Redwood Research vizsgálata szerint a jelenlegi tesztek jelentősen alulbecsülhetik, hogy a következtető modellek mennyire képesek irányítani saját gondolkodási…