Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Arize AI Harborral teszi mérhetővé az AI-ügynökök működését

2026. október 5. 16:19Forrás: Arize AI
Az Arize AI Harborral teszi mérhetővé az AI-ügynökök működését
Kép: Arize AI

Az Arize AI a Harbor nyílt forráskódú keretrendszerrel és az Arize Phoenix platformmal alakított ki reprodukálható módszert az AI-ügynökök, MCP-szerverek, készségek és parancssori eszközök tesztelésére. A rendszer ugyanazokat a feladatokat, környezeteket és ellenőrzőket használhatja különböző ügynökök összehasonlításához.

A lényeg röviden
  • A Harbor minden ügynökpróbát friss, elkülönített homokozóban futtat.
  • Ugyanazok a feladatok több ügynök, MCP-szerver és CLI összehasonlítására használhatók.
  • A Phoenix a feladatokat adatkészletként, a futtatásokat kísérletként és nyomkövetésként rögzíti.
  • A verifikátorok a helyességet, a fordulók és eszközhívások számát, valamint a végrehajtási hibákat is jelölhetik.
  • Az Arize AI 2026. október 8-án élőben mutatja be a PXI-benchmarkot.

A reprodukálhatóság az ügynökök tesztelésének kulcsa

Az Arize AI szerint az AI-ügynökök fejlesztésének egyik legnehezebb része az élesítés előtti, offline értékelés. Egy megbízható összehasonlításhoz minden verziónak ugyanazokat a feladatokat, adatokat, eszközöket és környezetet kell használnia, a futtatások között pedig vissza kell állítani az állapotot.

A vállalat ezt a problémát a Phoenixbe épített PXI kódolóügynök vizsgálatakor tapasztalta. A kezdeti tesztek egyetlen fordulóban ellenőrizték az eszközhívásokat, de nem tartalmaztak minden olyan környezeti információt, amelyet a felület biztosított, például az aktuális oldalt és időt. Egyes eszközök csak a felületen keresztül tudtak működni, az MCP-szerver hozzáadása pedig további utánzandó elemet jelentett. Valódi Phoenix-adatbázis nélkül azt lehetett ellenőrizni, hogy az ügynök meghívott-e egy eszközt, azt viszont alig, hogy mit kezdett az eredménnyel.

A Harbor minden próbálkozást külön homokozóban futtat

A Harbor nyílt forráskódú keretrendszer olyan kódolóügynök-benchmarkok mögött áll, mint a Terminal-Bench. A működéséhez egy feladatot, az alkalmazást és az adatokat tartalmazó környezetet, valamint a sikerességet ellenőrző verifikátort kell megadni. A Harbor minden próbálkozást friss, elkülönített homokozóban futtat, helyi Docker-környezetben vagy a támogatott felhős szolgáltatók egyikén.

A futtatás végén a verifikátor teszteket indít, és jutalmat állít elő. A PXI esetében az Arize AI a valódi ügynökvégpontot egy előre feltöltött nyomkövetéseket tartalmazó Phoenix-szerverrel futtatta. Így az ügynök valós eszközeredményekkel dolgozott, a fejlesztők pedig utólag megvizsgálhatták az adatbázis állapotát.

A Harbor támogatja a Claude Code és a Codex kódolóügynököket, valamint az egyedi ügynököket is. Ugyanazokkal a feladatokkal tesztelhető a PXI, az Arize MCP-szervere és a Phoenix CLI. Ha például egy ügynöknek hibás nyomkövetéseket kell megjegyzésekkel ellátnia, a verifikátor ellenőrizheti, hogy a megfelelő adatbázisrekordok módosultak-e.

A Phoenix az eredményeket kísérletekké és nyomkövetésekké alakítja

A Phoenixhez készült bővítmény a Harbor feladatait verziózott adatkészletekként, az egyes ügynökkonfigurációkat kísérletekként, a verifikátorok jutalmait pedig Phoenix-megjegyzésekként rögzíti. A Harbor által felvett munkafolyamatból Phoenix-nyomkövetés is készül, amelyben megvizsgálhatók a modellhívások, az eszközhasználat és a rendelkezésre álló használati adatok.

A felület egy helyen mutatja a feladatot, az opcionális referencia-választ és az ügynök végső válaszát, továbbá a helyességre, a fordulókra és az eszközhívásokra vonatkozó jelöléseket. Minden verifikátori jutalom megjelenik Phoenix-megjegyzésként, az infra_ok jelölés pedig a végrehajtási hibákat jelzi.

Ha változnak a feladatok, a bővítmény új adatkészlet-verziót hoz létre, miközben a korábbi kísérletek az eredeti verzióhoz kötve maradnak. Ez segíthet elkülöníteni az ügynök fejlődését attól, amikor maga a teszt változott. Az eredmények a Phoenix MCP-szerverén és CLI-ján keresztül is elérhetők.

A sikeres válasz mögötti munkafolyamat is számít

Az Arize AI a PXI-t, a Claude Code-ot és a Codexet ugyanazokkal, egy Phoenix-projektre vonatkozó kérdésekkel tesztelte. A válaszok szinte mind helyesek voltak, a nyomkövetések azonban különbségeket mutattak az ügynökök munkamódszerében.

Egy esetben a Codex helyesen azonosított egy hibás eszközt, de a vállalat hibaanalízishez készült készsége miatt a kérdéshez képest túl hosszú folyamatot követett. A nyomkövetés megmutatta, hogy az ügynöknek különbséget kell tennie a gyors diagnózis és a teljes körű vizsgálat között. Az Arize AI szerint a módosítások ezután ugyanazokon a feladatokon tesztelhetők, és ellenőrizhető, hogy csökkentik-e a fordulók és az eszközhívások számát a helyesség romlása nélkül.

A vállalat javasolt kiindulópontja egy, a felhasználók számára fontos feladat, reális környezet és egy eredményellenőrző. A fejlesztők lefuttathatják az alapállapotot, megvizsgálhatják a nyomkövetést, módosíthatnak egy utasítást, készséget vagy eszközt, majd ugyanazt a feladatot újraindíthatják. Az Arize AI szerint erre a visszacsatolási körre olyan optimalizálók is építhetők, mint a GEPA.

A beállítást és a PXI-benchmarkot 2026. október 8-án élő bemutatón ismertetik a „Benchmarking AI agents & tool use with Harbor and Arize Phoenix” eseményen. A felhasználók számára a megközelítés azt jelenti, hogy az ügynökök helyessége mellett a munkafolyamat hossza, az eszközhasználat és a végrehajtási hibák is vizsgálhatóvá válhatnak.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat

A VAST Data szerint az AI alkalmazások fejlesztése új technikai felületeket hoz a mindennapi munkába. A vállalat CAMP néven foglalja össze a kódoló ügynököket, az…

A VAST Data szerint új fejlesztői verem formálódik az AI körül
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői verem formálódik az AI körül

A VAST Data szerint az AI-alkalmazások fejlesztése új alapokra helyezi a fejlesztői verem működését. A vállalat CAMP néven foglalja össze a négy meghatározó területet: a…