A Snorkel AI vállalati környezetekben tanítaná az AI-ügynököket

A vállalati AI-ügynökök teljesítményét nem lehet megbízhatóan a végső válasz alapján megítélni, állítja a Snorkel AI. A kutatócsoport olyan szimulált vállalati környezeteket épít, amelyekben az ügynökök dokumentumokat olvashatnak, belső eszközöket használhatnak és munkafolyamatokat hajthatnak végre.
- A Snorkel AI szimulált vállalati környezeteket épít AI-ügynökök értékeléséhez és tanításához.
- Az értékelés az eszközhasználatot, a szabálykövetést, az állapotváltozásokat és a végső eredményt is vizsgálja.
- A vállalati szabályok eltérhetnek az iparági általános gyakorlattól.
- Az oracle ügynökök azt ellenőrzik, hogy a létrehozott munkafolyamat végrehajtható-e.
- A környezeteknek egyszerre kell megoldhatónak, életszerűnek és kellően nehéznek lenniük.
A végső válasz önmagában kevés
A Snorkel AI 2026. augusztus 3-án közzétett bejegyzése szerint a legtöbb ügynökbenchmark csak a munkafolyamat egy szűk részét vizsgálja. Az ügynök feladatot kap, választ ad, majd pontozzák, miközben az epizód véget ér.
Egy vállalati folyamat ennél összetettebb lehet. Egy biztosítási kockázatértékelő ügynöknek például szabályzatokat és ügyféladatokat kell átnéznie, belső eszközöket kell meghívnia, hiányzó információkról kell kérdeznie egy szimulált felhasználót, módosítania kell az állapotot, és be kell tartania a jóváhagyási szabályokat. A helyesnek tűnő végső mondat ezért önmagában nem bizonyítja, hogy a teljes folyamat megfelelően zajlott le.
A Snorkel kutatócsoportja biztosítási, pénzügyi, gyártási, jogi, valamint értékesítési és marketingterületekre épít ilyen környezeteket. A cél, hogy a szakértői tudásból szimulált vállalatok és munkafolyamat-rendszerek jöjjenek létre, amelyek értékelésre és megerősítéses tanulásra is használhatók.
Eszközök, állapotok és vállalati szabályok
A vállalati környezet meghatározza, milyen eszközöket hívhat meg az ügynök, milyen állapotokat módosíthat, milyen dokumentumokat vizsgálhat, kikkel léphet kapcsolatba, és milyen szabályokat kell követnie. Így az értékelés a teljes munkafolyamatban történik, nem csak a végső válaszon.
A rendszerben az ügynök cselekszik, a környezet megváltozik, majd egy értékelő pontozza az eredményt. Ez a pontszám a teljesítmény mérésére, valamint a jövőbeli műveleteket kiválasztó szabályzat frissítésére is felhasználható a megerősítéses tanulásban.
A Snorkel példája szerint egy általános modell tudhatja, hogy egy tipikus hitelfolyamatban 10 000 dollárig engedélyezhető jóváhagyás. Egy konkrét vállalatnál ugyanakkor 1 000 dollár lehet a határ. Az ügynök akkor jut helyes eredményre, ha ellenőrzi a vállalati környezetet, és nem az általános szabályra támaszkodik.
A megbízhatóságot a teljes folyamat alapján mérik
A Snorkel a nyilvános rendszerek példái között a Tau-Benchet, a TerminalBenchet és az OSWorldt említi. A Tau-Benchben az ügynök szimulált felhasználóval kommunikál, API-eszközöket választ, légitársasági vagy kiskereskedelmi szabályokat követ, majd az adatbázis végső állapotát vetik össze a célállapottal. Egy ülésmódosítás például akkor sikertelen, ha az ügynök azt állítja, hogy megtörtént a változtatás, de az adatbázisban továbbra is a régi ülés szerepel.
A vállalati környezetek kialakításakor a Snorkel szerint három szempontot kell egyensúlyba hozni: a megoldhatóságot, a realizmust és a nehézséget. A feladatnak rendelkeznie kell legalább egy érvényes végrehajtási útvonallal, miközben megőrizheti a hiányos nyilvántartásokat, a kivételeket és a felhasználói bizonytalanságot.
A kutatócsoport úgynevezett oracle ügynökökkel ellenőrzi, hogy a létrehozott környezetben végigvihető-e a folyamat. Ezek az ügynökök dokumentumokat vizsgálhatnak, adatbázis-állapotot kérdezhetnek le és elérhető eszközöket hívhatnak meg. Ha több fejlett modell tartósan eltérő eredményre jut, az hiányzó bizonyítékra, ellentmondó szabályokra vagy több lehetséges értelmezésre utalhat, ami szakértői felülvizsgálatot igényel.
Snorkel AI: Enterprise environments and training AI agents for real-world workflows


