Az AI-ügynökök értékelését részfeladatokra bontaná a Snorkel AI

A hosszú, több eszközön és állapoton átívelő AI-feladatoknál félrevezető lehet az egyszerű siker vagy kudarc jelölés. A Snorkel AI mérföldkőalapú értékelést javasol, amely a részleges előrehaladást és a hibák pontos helyét is megőrzi.
- A végső sikerpontszám elrejtheti a hosszú feladatok közbeni részleges előrehaladást.
- A mérföldkő-nyom a hibák kezdetét és a blokkolt későbbi lépéseket is megmutatja.
- Az Agents’ Last Exam kapu és részletes pontozás kombinációját használja több mint 1000 feladaton.
- Az OSWorld 2.0 bináris és részleges pontozása jelentősen eltérő képet adhat ugyanarról a teljesítményről.
A végső pontszám elrejtheti a korábbi munkát
A hosszú időhorizontú AI-ügynökök több, egymástól függő állapoton és átmeneten keresztül dolgoznak. Egy feladat magában foglalhat bizonyítékok kutatását, fájlok vagy nyilvántartások módosítását, külső válaszokra várakozást, a terv felülvizsgálatát és a köztes eredmények ellenőrzését.
Az ilyen folyamatokban egy késői hiba miatt az egész feladat sikertelennek minősülhet, miközben az ügynök a munka nagy részét helyesen végezte el. A Snorkel AI szerint a terminálpontszám nem különíti el a rossz tervet attól a többnyire helyes munkafolyamattól, amely egyetlen függőség, jóváhagyás, ellenőrzés vagy állapotváltás miatt tört meg.
A vállalat példái között szerepel az értékesítési lehetőség több napon át tartó kezelése, egy marketingkampány kutatástól a mérésig tartó lebonyolítása, a havi pénzügyi zárás, valamint egy éles kódmódosítás végigvezetése nagy kódbázison.
A mérföldkövek a hiba kezdetét keresik
A javasolt módszer nem csak a végrehajtott műveleteket rögzíti. A mérföldkő-nyomnak azt is meg kell mutatnia, hogy az ügynök milyen állapotokon haladt át, és az egyes átmenetek valóban közelebb vitték-e a feladathoz.
Ez azért fontos, mert egy pálya akár több tucat lépésen keresztül is ésszerűnek tűnhet, miközben az ügynök már korábban rossz állapotba került. A mérföldkőalapú értékelés megkeresi, hol kezdődött az eltérés, és feltárja, mely későbbi munkafázisok váltak elérhetetlenné.
A Snorkel AI által ismertetett korábbi kutatások ugyanezt az elvet alkalmazták kisebb léptékben. A Math-Shepherd és a Let’s Verify Step by Step köztes gondolkodási lépéseket ellenőrzött, az AgentBoard részfeladatok teljesítését követte, a TheAgentCompany pedig ellenőrzött munkafázisok után részpontokat adott. Az AgentBench több interaktív környezetben, a WebArena pedig a környezet állapotain keresztül vizsgálta az ügynökök teljesítményét.
A benchmarkok egyre több részleges teljesítményt mérnek
A vállalat szerint a hosszú feladatoknál a részpontozást gyakran szigorú feltételekkel kell kombinálni. Ha például kötelező fájlok hiányoznak, a kimenet nem értelmezhető, vagy érvénytelen állapot jön létre, a tesztnek előbb el kell buknia a kapun, és csak érvényes kimenet esetén következhet a minőség részletes pontozása.
Az Agents’ Last Exam ilyen kapu és pontozás struktúrát használ. A benchmark több mint 1000 feladatot fed le 55 részterületen és 13 iparági csoportban. A kapu az előfeltételeket ellenőrzi, sikeres teljesítés után pedig súlyozott rubrika adhat részpontokat a teljességre, helyességre és minőségre. A forrás szerint a legnehezebb szinten a teljes siker átlagos aránya 1 százalék alatt marad, ezért a puszta siker vagy kudarc a legtöbb eredményt közel nullára sűrítené.
Az OSWorld 2.0 átlagosan 27,25 feladatspecifikus ellenőrzési ponttal értékeli 108 számítógép-használati feladat környezetének végső állapotát. A legerősebb konfiguráció szigorú bináris pontozással a feladatok 20,6 százalékát teljesítette, részpontszáma azonban 54,8 százalék volt. A WindowsWorld pedig 181 feladatot vizsgál 17 professzionális Windows-alkalmazásban, a feladatok 78 százaléka több alkalmazást érint.
Snorkel AI: Milestone-Based Evaluation and Training for Long-Horizon AI Agents


