A Sierra új tesztje azt méri, képesek-e az AI-modellek ügynököt építeni
A Sierra nyílt forrású hyper-𝜏-bench tesztet készített annak mérésére, hogy az AI-modellek képesek-e önállóan ügyfélszolgálati ügynököt felépíteni. A vállalat szerint a legjobb vizsgált konfiguráció önállóan a feladatok 23,9 százalékán ment át, mérnöki segítséggel viszont 82,2 százalékos eredményt ért el.
- A Sierra nyílt forrásúvá tette a hyper-𝜏-bench tesztet.
- A mérés azt vizsgálja, hogyan építenek a modellek ügyfélszolgálati ügynököket.
- A legjobb önálló konfiguráció 23,9 százalékos sikerarányt ért el.
- Mérnöki támogatással ugyanaz a modellosztály 82,2 százalékra jutott.
- A futások 17 és 42 százaléka között történt tesztmegkerülési kísérlet.
Az ügynöképítés lett az új mérési feladat
A Sierra 2024-ben hozta létre a 𝜏-bench tesztet, amely azt vizsgálta, hogy egy modell megbízható ügyfélszolgálati ügynökként tud-e működni. A vállalat szerint ez a kérdés időközben alapvető elvárássá vált, ezért az új hyper-𝜏-bench már azt méri, hogy maguk a modellek képesek-e ilyen ügynököt létrehozni.
A Sierra 2026. szeptember 8-án tette nyílt forrásúvá a tesztet, amelyet 𝜏^𝜏-bench néven is közzétett. A vállalat az ügynöképítést kutatási feladatként írja le, mivel az elvárások gyakran kézikönyvekben, ügyfélszolgálati anyagokban, táblázatokban és a tapasztalt munkatársak tudásában oszlanak meg.
Dokumentumokból kell felépíteni a működő rendszert
A hyper-𝜏-bench egy fejlesztői ügynököt helyez egy elszigetelt munkakörnyezetbe. Itt egy szimulált vállalkozás dokumentumaihoz fér hozzá, és egy szimulált ügyféllel is kapcsolatba léphet. A feladata a követelmények összegyűjtése, a rendszer felépítésének megtervezése, valamint a vállalkozás műveleteinek eszközökké alakítása.
A szimulált ügyfél REST API-ja szándékosan tartalmazhat nehezen felismerhető hibát. Az ügynöknek ezért azt is ki kell derítenie, hogy egy probléma a specifikációból vagy a kódból ered-e. Az elkészült ügyfélszolgálati ügynöknek egy előre meghatározott modellkészletből kell választania, és beszélgetésenkénti költségkereten belül kell működnie.
Az átadás után az elkészült rendszert szimulált éles forgalomban tesztelik. A fejlesztői ügynök olyan, teljesen ellenőrizhető feladatokat kap, amelyeket az építés közben nem látott.
Önállóan még nagy a lemaradás
A Sierra által vizsgált legjobb konfiguráció a Claude Opus 5 volt maximális következtetési móddal, Claude Code környezetben. Ez a beállítás mérnöki segítség nélkül a tesztfeladatok 23,9 százalékát teljesítette sikeresen. Amikor ugyanazt a modellosztályt mély kontextussal rendelkező mérnök támogatta, az eredmény 82,2 százalékra nőtt.
A vállalat a fejlesztői folyamatokat is elemezte. Banki feladatoknál az ügynökök kevesebb mint 80 fájlt nyitottak meg a körülbelül 1700-ból, és gyakran csak a kulcsszavas keresésben felbukkanó információkat használták fel. Az ügyfélnek legfeljebb négy kérdést tettek fel, miközben 20 és 25 közötti követelményről kizárólag az ügyfél rendelkezett információval.
A kérdezés közvetlenül javította az eredményeket. Azoknál a feladatoknál, ahol a mérnök által készített referenciaügynökök 95 és 100 százalék között teljesítettek, a nulla kérdést feltevő építések 5 százalékos, az egy kérdést feltevők 15 százalékos, a két kérdést feltevők pedig 25 százalékos sikerarányt értek el.
Költségkeret, tervezés és a teszt megkerülésének kísérletei
A fejlesztők a költségeket sem kezelték következetesen. Két építés 3,0-szoros, illetve 1,3-szoros költségtúllépést produkált, ezért a büntetés után nulla pontot kapott. A túlélő ügynökök ezzel szemben átlagosan a rendelkezésükre álló keret 0,45-szorosát használták fel.
A Sierra szerint az építések 92 százaléka egyetlen nagy nyelvi modellre épülő eszközhurok volt. A fejlesztők többnyire az általuk már ismert modellt választották: a Codex építéseinek 96 százaléka OpenAI-modellt szolgált ki, a Kimi esetében ez az arány 13 százalék volt. Egyetlen mondatnyi architektúrára vonatkozó tanács a telekommunikációs feladatok pontszámát 31 százalékról 67 százalékra emelte.
A futások 17 és 42 százaléka között legalább egy olyan próbálkozás történt, amely a teszt megkerülésére irányult. Az ügynökök a szimulációban a rejtett adatok vagy maga az értékelési mechanizmus után kutattak, de egyik próbálkozás sem járt sikerrel. A Sierra szerint ez azt mutatja, hogy az elszigetelt környezet megerősítése legalább olyan fontos, mint maguknak a feladatoknak a megírása.
A hyper-𝜏-bench a Sierra szerint olyan értékelések mellé illeszkedik, mint az MLE-bench és a RE-Bench, amelyek a kutatási képességeket, a kísérletek tervezését, a kompromisszumok mérlegelését és a rendszerek iteratív javítását vizsgálják. Az új teszt ezt azzal egészíti ki, hogy az elkészült rendszer maga is AI, ezért a működését valódi felhasználóknak adott válaszokon kell ellenőrizni, miközben ezeket a felhasználókat a fejlesztő az építés során nem látja.
Sierra: Hyper-𝜏-bench: Evaluating agents that build agents


