Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Snorkel AI vállalati környezetekben tanítaná az AI-ügynököket

2026. augusztus 3.Forrás: Snorkel AI
A Snorkel AI vállalati környezetekben tanítaná az AI-ügynököket
Kép: Snorkel AI

A vállalati AI-ügynökök teljesítményét nem lehet megbízhatóan a végső válasz alapján megítélni, állítja a Snorkel AI. A kutatócsoport olyan szimulált vállalati környezeteket épít, amelyekben az ügynökök dokumentumokat olvashatnak, belső eszközöket használhatnak és munkafolyamatokat hajthatnak végre.

A lényeg röviden
  • A Snorkel AI szimulált vállalati környezeteket épít AI-ügynökök értékeléséhez és tanításához.
  • Az értékelés az eszközhasználatot, a szabálykövetést, az állapotváltozásokat és a végső eredményt is vizsgálja.
  • A vállalati szabályok eltérhetnek az iparági általános gyakorlattól.
  • Az oracle ügynökök azt ellenőrzik, hogy a létrehozott munkafolyamat végrehajtható-e.
  • A környezeteknek egyszerre kell megoldhatónak, életszerűnek és kellően nehéznek lenniük.

A végső válasz önmagában kevés

A Snorkel AI 2026. augusztus 3-án közzétett bejegyzése szerint a legtöbb ügynökbenchmark csak a munkafolyamat egy szűk részét vizsgálja. Az ügynök feladatot kap, választ ad, majd pontozzák, miközben az epizód véget ér.

Egy vállalati folyamat ennél összetettebb lehet. Egy biztosítási kockázatértékelő ügynöknek például szabályzatokat és ügyféladatokat kell átnéznie, belső eszközöket kell meghívnia, hiányzó információkról kell kérdeznie egy szimulált felhasználót, módosítania kell az állapotot, és be kell tartania a jóváhagyási szabályokat. A helyesnek tűnő végső mondat ezért önmagában nem bizonyítja, hogy a teljes folyamat megfelelően zajlott le.

A Snorkel kutatócsoportja biztosítási, pénzügyi, gyártási, jogi, valamint értékesítési és marketingterületekre épít ilyen környezeteket. A cél, hogy a szakértői tudásból szimulált vállalatok és munkafolyamat-rendszerek jöjjenek létre, amelyek értékelésre és megerősítéses tanulásra is használhatók.

Eszközök, állapotok és vállalati szabályok

A vállalati környezet meghatározza, milyen eszközöket hívhat meg az ügynök, milyen állapotokat módosíthat, milyen dokumentumokat vizsgálhat, kikkel léphet kapcsolatba, és milyen szabályokat kell követnie. Így az értékelés a teljes munkafolyamatban történik, nem csak a végső válaszon.

A rendszerben az ügynök cselekszik, a környezet megváltozik, majd egy értékelő pontozza az eredményt. Ez a pontszám a teljesítmény mérésére, valamint a jövőbeli műveleteket kiválasztó szabályzat frissítésére is felhasználható a megerősítéses tanulásban.

A Snorkel példája szerint egy általános modell tudhatja, hogy egy tipikus hitelfolyamatban 10 000 dollárig engedélyezhető jóváhagyás. Egy konkrét vállalatnál ugyanakkor 1 000 dollár lehet a határ. Az ügynök akkor jut helyes eredményre, ha ellenőrzi a vállalati környezetet, és nem az általános szabályra támaszkodik.

A megbízhatóságot a teljes folyamat alapján mérik

A Snorkel a nyilvános rendszerek példái között a Tau-Benchet, a TerminalBenchet és az OSWorldt említi. A Tau-Benchben az ügynök szimulált felhasználóval kommunikál, API-eszközöket választ, légitársasági vagy kiskereskedelmi szabályokat követ, majd az adatbázis végső állapotát vetik össze a célállapottal. Egy ülésmódosítás például akkor sikertelen, ha az ügynök azt állítja, hogy megtörtént a változtatás, de az adatbázisban továbbra is a régi ülés szerepel.

A vállalati környezetek kialakításakor a Snorkel szerint három szempontot kell egyensúlyba hozni: a megoldhatóságot, a realizmust és a nehézséget. A feladatnak rendelkeznie kell legalább egy érvényes végrehajtási útvonallal, miközben megőrizheti a hiányos nyilvántartásokat, a kivételeket és a felhasználói bizonytalanságot.

A kutatócsoport úgynevezett oracle ügynökökkel ellenőrzi, hogy a létrehozott környezetben végigvihető-e a folyamat. Ezek az ügynökök dokumentumokat vizsgálhatnak, adatbázis-állapotot kérdezhetnek le és elérhető eszközöket hívhatnak meg. Ha több fejlett modell tartósan eltérő eredményre jut, az hiányzó bizonyítékra, ellentmondó szabályokra vagy több lehetséges értelmezésre utalhat, ami szakértői felülvizsgálatot igényel.

Kapcsolódó hírek

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3.

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt
Termékek és eszközök2026. október 2.

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt

Általánosan elérhetővé vált a CoreWeave ARIA, egy kutatási és iterációs AI-ügynök, amely a CoreWeave Forge részeként segít modellek és AI-ügynökök fejlesztésében. Az…

AutoSynthData: vállalati ügynökök képzési adatain dolgozik a Hugging Face
Kutatás2026. október 2.

AutoSynthData: vállalati ügynökök képzési adatain dolgozik a Hugging Face

A Hugging Face oldalán megjelent az „AutoSynthData: Generating Training Data for Enterprise Agents” című anyag. A forrás címe szerint a téma a vállalati ügynökök számára…