Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az AI-ügynökök értékelését részfeladatokra bontaná a Snorkel AI

2026. augusztus 5.Forrás: Snorkel AI
Az AI-ügynökök értékelését részfeladatokra bontaná a Snorkel AI
Kép: Snorkel AI

A hosszú, több eszközön és állapoton átívelő AI-feladatoknál félrevezető lehet az egyszerű siker vagy kudarc jelölés. A Snorkel AI mérföldkőalapú értékelést javasol, amely a részleges előrehaladást és a hibák pontos helyét is megőrzi.

A lényeg röviden
  • A végső sikerpontszám elrejtheti a hosszú feladatok közbeni részleges előrehaladást.
  • A mérföldkő-nyom a hibák kezdetét és a blokkolt későbbi lépéseket is megmutatja.
  • Az Agents’ Last Exam kapu és részletes pontozás kombinációját használja több mint 1000 feladaton.
  • Az OSWorld 2.0 bináris és részleges pontozása jelentősen eltérő képet adhat ugyanarról a teljesítményről.

A végső pontszám elrejtheti a korábbi munkát

A hosszú időhorizontú AI-ügynökök több, egymástól függő állapoton és átmeneten keresztül dolgoznak. Egy feladat magában foglalhat bizonyítékok kutatását, fájlok vagy nyilvántartások módosítását, külső válaszokra várakozást, a terv felülvizsgálatát és a köztes eredmények ellenőrzését.

Az ilyen folyamatokban egy késői hiba miatt az egész feladat sikertelennek minősülhet, miközben az ügynök a munka nagy részét helyesen végezte el. A Snorkel AI szerint a terminálpontszám nem különíti el a rossz tervet attól a többnyire helyes munkafolyamattól, amely egyetlen függőség, jóváhagyás, ellenőrzés vagy állapotváltás miatt tört meg.

A vállalat példái között szerepel az értékesítési lehetőség több napon át tartó kezelése, egy marketingkampány kutatástól a mérésig tartó lebonyolítása, a havi pénzügyi zárás, valamint egy éles kódmódosítás végigvezetése nagy kódbázison.

A mérföldkövek a hiba kezdetét keresik

A javasolt módszer nem csak a végrehajtott műveleteket rögzíti. A mérföldkő-nyomnak azt is meg kell mutatnia, hogy az ügynök milyen állapotokon haladt át, és az egyes átmenetek valóban közelebb vitték-e a feladathoz.

Ez azért fontos, mert egy pálya akár több tucat lépésen keresztül is ésszerűnek tűnhet, miközben az ügynök már korábban rossz állapotba került. A mérföldkőalapú értékelés megkeresi, hol kezdődött az eltérés, és feltárja, mely későbbi munkafázisok váltak elérhetetlenné.

A Snorkel AI által ismertetett korábbi kutatások ugyanezt az elvet alkalmazták kisebb léptékben. A Math-Shepherd és a Let’s Verify Step by Step köztes gondolkodási lépéseket ellenőrzött, az AgentBoard részfeladatok teljesítését követte, a TheAgentCompany pedig ellenőrzött munkafázisok után részpontokat adott. Az AgentBench több interaktív környezetben, a WebArena pedig a környezet állapotain keresztül vizsgálta az ügynökök teljesítményét.

A benchmarkok egyre több részleges teljesítményt mérnek

A vállalat szerint a hosszú feladatoknál a részpontozást gyakran szigorú feltételekkel kell kombinálni. Ha például kötelező fájlok hiányoznak, a kimenet nem értelmezhető, vagy érvénytelen állapot jön létre, a tesztnek előbb el kell buknia a kapun, és csak érvényes kimenet esetén következhet a minőség részletes pontozása.

Az Agents’ Last Exam ilyen kapu és pontozás struktúrát használ. A benchmark több mint 1000 feladatot fed le 55 részterületen és 13 iparági csoportban. A kapu az előfeltételeket ellenőrzi, sikeres teljesítés után pedig súlyozott rubrika adhat részpontokat a teljességre, helyességre és minőségre. A forrás szerint a legnehezebb szinten a teljes siker átlagos aránya 1 százalék alatt marad, ezért a puszta siker vagy kudarc a legtöbb eredményt közel nullára sűrítené.

Az OSWorld 2.0 átlagosan 27,25 feladatspecifikus ellenőrzési ponttal értékeli 108 számítógép-használati feladat környezetének végső állapotát. A legerősebb konfiguráció szigorú bináris pontozással a feladatok 20,6 százalékát teljesítette, részpontszáma azonban 54,8 százalék volt. A WindowsWorld pedig 181 feladatot vizsgál 17 professzionális Windows-alkalmazásban, a feladatok 78 százaléka több alkalmazást érint.

Kapcsolódó hírek

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott
Kutatás2026. október 3.

A forrás címe szerint az ügynök elkészült, az adatbázis mást mutatott

A Hugging Face oldalának címe szerint egy ügynök késznek jelentett egy feladatot, az adatbázis azonban ellentmondott ennek. A megadott forrásrészlet a történet részletes…

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI
Kutatás2026. október 2.

MedPAIR azt vizsgálja, ugyanazt tartja-e fontosnak az orvos és az AI

A MedPAIR adatbázis azt méri, hogy az orvosok és a nagy nyelvi modellek ugyanazokat a mondatokat tartják-e fontosnak egy klinikai kérdés megválaszolásához. A kutatásban…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…