Az AWS az ügynökrendszerek magyarázhatóságát is mérné

Az AWS olyan értékelési keretrendszert mutatott be az Amazon Bedrock AgentCore részeként, amely a többügynökös rendszerek hasznosságát, feladatvégrehajtását és magyarázhatóságát vizsgálja. A megoldás beépített és egyedi értékelőkkel ellenőrizheti, hogy az ügynökök megfelelő eszközöket választanak-e, betartják-e az üzleti korlátokat, és indokolják-e döntéseiket.
- Az AgentCore Evaluations beépített és egyedi értékelőkkel méri az ügynökök teljesítményét.
- A keretrendszer az eszközválasztást, a feladatvégrehajtást és az üzleti korlátok betartását is vizsgálja.
- Külön értékelők ellenőrzik a döntések indoklását és az alátámasztó adatok használatát.
- Az on-demand mód fejlesztési és CI/CD tesztekhez, az online mód éles megfigyeléshez készült.
- Az AWS egy többügynökös ellátásilánc-rendszeren mutatja be a megoldást.
A nyelvi válasz minősége önmagában kevés
Az AWS október 5-i közleménye szerint a többügynökös rendszerek éles használatának egyik fontos kérdése, hogy ezek a rendszerek valós helyzetekben következetesen hasznos, pontos és magyarázható eredményeket adjanak. A vállalat szerint az ilyen rendszereket egyre több összetett feladatra alkalmazzák, például ellátásilánc-tervezésre, pénzügyi elemzésre és ügyfélkezelési műveletekre.
Ezek a rendszerek több, különböző feladatra szakosodott ügynököt hangolnak össze. Az ügynökök döntéseket hozhatnak, munkafolyamatokat hajthatnak végre, valamint használható ajánlásokat készíthetnek. Az AWS szerint a nagy nyelvi modellek gördülékeny válaszai önmagukban nem adnak elegendő garanciát vállalati környezetben. Azt is vizsgálni kell, hogy az ügynök megfelelően követi-e az utasításokat, a megfelelő eszközt választja-e, betartja-e a korlátokat, és világosan bemutatja-e a következtetéséhez vezető érveket.
Az Amazon Bedrock AgentCore platformot ügynökök nagy léptékű építésére, összekapcsolására és optimalizálására kínálja az AWS, keretrendszertől és modelltől függetlenül. Az AgentCore Evaluations menedzselt szolgáltatásként az ügynökök teljesítményének fejlesztési és éles környezetben történő mérését célozza.
Három szinten vizsgálnák az ügynökök működését
Az AWS bemutatója háromrétegű megközelítést használ. Az első rétegben beépített értékelők mérik az általános minőséget. Ilyen a Helpfulness, vagyis a hasznosság, valamint az egyes ügynökökhöz kapcsolódó célzott vizsgálat. A koordináló ügynöknél a Tool Selection Accuracy az eszközválasztás pontosságát méri, az optimalizáló és elosztási ügynöknél a Response Relevance a válasz relevanciáját vizsgálja, az útvonaltervezőnél az Instruction Following az utasításkövetést, az elemzőnél pedig a Faithfulness a forrásokhoz való hűséget.
A második réteg egyedi, üzleti szabályokra épülő értékelőket ad hozzá. Ezek ellenőrizhetik többek között a költségkeretek és készletkorlátok betartását, azt, hogy az ajánlás aktuális készlet- és keresleti adatokon alapul-e, továbbá az útvonalak megvalósíthatóságát és az SQL-lekérdezések helyességét. A koordináló ügynöknél azt is vizsgálják, hogy az alügynökök eredményeiből koherens, egymásnak nem ellentmondó ajánlás áll-e össze.
A harmadik réteg a magyarázhatóságot önálló értékelési szempontként kezeli. Az egyedi értékelők ellenőrizhetik, hogy az ügynök kifejti-e a döntés indokát, hivatkozik-e a támogató adatokra vagy eszközkimenetekre, és bemutatja-e az olyan kompromisszumokat, mint a költség és a szolgáltatási szint közötti választás.
Ellátásilánc-példán mutatják be a működést
Az AWS egy kitalált globális kiskereskedő, az AnyCompany Retail példáján szemlélteti a megoldást. A vállalatnál egyes régiókban promóciók idején készlethiány alakul ki, máshol viszont túl sok termék marad raktáron. A szállítási csapatnak közben a kézbesítési sebességet, a fuvarozói kapacitást és a költséget is egyensúlyban kell tartania.
A bemutatott rendszer készletallokáció optimalizálásában, elosztási módosítások ajánlásában, a készlet állapotának elemzésében, valamint útvonal- és teljesítési forgatókönyvek szimulációjában segítené a tervezőket. A megoldás a Strands Agents SDK-t, az Amazon Bedrock AgentCore MCP Servert és az AgentCore Evaluations szolgáltatást használja.
A rendszerben egy koordináló ügynök és négy szakosodott alügynök szerepel: optimalizáló, elosztási, útvonaltervező és elemző ügynök. A koordináló ügynök a tervező kérését a megfelelő alügynökökhöz továbbítja. Az optimalizáló ügynök MCP-eszközöket hív, az elosztási ügynök készlet-újraelosztási ajánlásokat készít, az útvonaltervező fuvarozói és útvonalopciókat ajánl, az elemző pedig az ellátási lánccal kapcsolatos diagnosztikai kérdésekre válaszol.
Fejlesztési tesztekre és éles megfigyelésre is használható
Az AgentCore Evaluations két működési módot támogat. Az igény szerinti, on-demand mód fejlesztési összehasonlításra, regressziós tesztelésre, valamint folyamatos integrációs és szállítási folyamatok kapuellenőrzésére szolgál. Az online mód folyamatos éles környezetbeli megfigyelést és riasztásokat tesz lehetővé.
Az AWS leírása szerint ugyanazok az egyedi értékelők használhatók mindkét módban. Az online konfigurációban az értékelők Amazon Resource Name, vagyis ARN azonosítóit és egy mintavételi arányt lehet megadni, például az éles nyomkövetések 1, 10 százalékát. A szolgáltatás az AgentCore Observability nyomait olvassa, pontozza azokat, majd az eredményeket Amazon CloudWatch irányítópultjaira és riasztásaiba továbbítja.
Az értékelés mellett az AWS az Amazon Bedrock Guardrails használatát is javasolja felelős mesterségesintelligencia-kontrollként. A Guardrails tartalomszűrést, tiltott témák felismerését és a megalapozottság ellenőrzését kínálja. Míg az értékelések a végrehajtás után mérik az ügynök minőségét, a Guardrails a végrehajtás közben érvényesíti a biztonsági korlátokat.
AWS: Evaluating multi-agent systems for explainability and helpfulness with Amazon Bedrock AgentCore


