A Terminal-Bench 4.0 folyamatos ellenőrzéssel tartaná értékét

Megjelent a Terminal-Bench 4.0, amely a feladatok szigorúbb ellenőrzésére, a reprodukálhatóságra és a benchmark folyamatos karbantartására épít. A Snorkel AI szerint a benchmarkoknak ugyanúgy aktív karbantartásra van szükségük, mint a szoftvereknek.
- Megjelent a Terminal-Bench 4.0.
- A feladatokat 35 szempontú ellenőrzés és több tesztelési kör vizsgálja.
- A készítők külön próbákon keresik a jutalmazás kijátszásának lehetőségeit.
- A 4.0 verzió rögzített lemezképeket, nagyobb idő-, CPU- és memóriakereteket tartalmaz.
- A benchmarkot időszakos frissítésekkel és folyamatos minőségbiztosítással fejlesztik.
A statikus benchmarkok gyorsan veszíthetnek az értékükből
Justin Bauer, a Snorkel AI vezető kutatója a vállalat blogján azt írja, hogy az új, élvonalbeli modellek megjelenése gyorsul, miközben a benchmarkok gyakran nehezen követik ezt a tempót. A legtöbb benchmark statikus adathalmazként működik, aktív karbantartás nélkül, ezért gyorsan veszíthet az értékéből.
A Terminal-Bench a frontier modellek modellkártyáin gyakran szereplő benchmarkok egyike. A 3.0-s kiadást a 4.0-s verzió követte, a készítők pedig azt a célt tűzték ki, hogy a benchmarkot folyamatosan karbantartják és fejlesztik. Ryan Marten, a Terminal-Bench vezetője ezt a megközelítést Continuous Benchmarks, vagyis folyamatos benchmarkok néven írta le.
Az alapgondolat szerint a benchmark szoftverhez hasonló termék, ezért a használhatóságának megőrzéséhez rendszeres ellenőrzésre és javításra van szükség. A Snorkel AI bejegyzése ezt a folyamatot a Terminal-Bench 3.0 és 4.0 közötti változásokon keresztül mutatja be.
Többlépcsős ellenőrzés készíti elő a feladatokat
A Terminal-Bench új adathalmazai nem egyszerűen feladatok gyűjteményei, hanem többlépcsős felülvizsgálati folyamat eredményei. Ennek része a statikus ellenőrzés, amely a struktúrát, a formázást, az abszolút elérési utakat, a tanítási adatokba kerülést megakadályozó jelzőszövegeket, valamint azt vizsgálja, hogy az ellenőrző rendszer a próba futtatásakor ne tölthessen le adatot.
A feladatokat egy 35 szempontból álló megvalósítási ellenőrzőlista alapján is vizsgálják. Ez többek között azt értékeli, hogy az utasításokból levezethetők-e a tesztek, illetve hogy a nehézséget valódi képességigény okozza-e, nem pedig egyszerűen a feladat körülményessége.
Az úgynevezett oracle- és no-op-ellenőrzésben a referenciamegoldásnak 1,0 pontot kell elérnie, a semmittevésnek pedig 0,0 pontot. Ezeket a teszteket minden módosításnál lefuttatják a folyamatos integrációs rendszerben. Ezután élő ügynökpróbák következnek, amelyek során a frontier ügynökök feladatokat oldanak meg, a felülvizsgálók pedig elemzik a futási nyomokat.
Külön próbákon azt is vizsgálják, hogy az ügynökök képesek-e kijátszani a jutalmazást. Egy ügynök például beolvashatja a tesztfájlokat, meghamisíthatja a kimenetet vagy módosíthatja az ellenőrzőt. A feladat csak akkor kerülhet végleges jóváhagyásra, ha ezekre a lehetőségekre is megfelelő választ ad.
A feladatokat a megjelenés után is vizsgálják
A végleges adathalmaz elkészítése után a készítők további benchmark-szintű teszteket is futtattak. Bauer külön vizsgálatban ellenőrizte, hogy a legnehezebb feladatok megoldhatók-e. A legtöbb ilyen feladat teljesíthető volt, néhány esetben azonban a problémákat visszaküldték a szerzőknek konkrét megállapításokkal.
A szerző szerint egy feladat lehet megfelelően formázott és működő környezetben futó, mégis megoldhatatlan a saját szerződése alapján. Előfordulhat például, hogy az utasítás egy irányt jelöl ki, az ellenőrző pedig mást vár, vagy a rendelkezésre álló idő nem elég a referenciamegoldásban feltételezett munkához. Ezeket a hibákat a megjelenés előtti ellenőrzések nem minden esetben tárják fel.
A csapat a referenciamegoldásokat és az ellenőrzőket párhuzamos, illetve egymást követő futtatásokkal is terhelte. Ez olyan hibákat hozhat felszínre, amelyek egyetlen tiszta futtatásban nem jelentkeznek. Az így felhalmozódó javítási feladatok miatt vezették be az új verziókezelési rendszert, amely időszakos benchmark-frissítéseket tesz lehetővé.
A 4.0 kiadás széles körű módosításokat tartalmaz
A Snorkel AI szerint egy új verzió nemcsak hibajavításokat jelent, hanem lehetőséget ad a teljes ranglista újrafuttatására is. A Terminal-Bench 4.0 több, minden feladatot érintő változást csomagol egy kiadásba.
- Rögzítették az alap- és a felépített lemezképek verzióit a reprodukálhatóság érdekében.
- Növelték az időkorlátokat.
- Növelték a CPU- és memóriakereteket.
- Javítottak egyes feladatokat.
- Eltávolítottak feladatokat.
A tesztelés során kiderült, hogy néhány feladat azért nem sikerült az ügynököknek, mert a rendelkezésre álló erőforráskeret nem fedte le a szükséges munkát. A bejegyzés ezt benchmark-szintű kalibrációs problémaként írja le, amelyet a teljes 3.0-s adathalmaz eredményeinek vizsgálata tett láthatóvá.
A következő lépés az újonnan azonosított ellenőrzési módszerek beépítése a későbbi folyamatokba. A csapat automatizált ellenőrzéseket és ügynököket is használna az új problémák előzetes felderítésére. A Snorkel AI szerint a folyamatos minőségbiztosítás segíthet abban, hogy a Terminal-Bench lépést tartson a frontier modellek fejlődésével.
Snorkel AI: Terminal-Bench 4.0: Why Continuous Benchmarks Require Continuous QA


