A LiveKit szimulált hívókkal tesztelhetővé tette a hangügynököket

A LiveKit általánosan elérhetővé tette az Agent Simulations eszközt, amely szimulált felhasználókkal teszteli a hangügynökök teljes feladatvégzését. A megoldás a beszélgetési logikát, illetve hangalapú módban a teljes audiofolyamatot is vizsgálhatja.
- Az Agent Simulations szimulált felhasználókkal teszteli a hangügynökök feladatait.
- A forgatókönyvek automatikusan futtathatók minden új módosítás után.
- A szöveges mód a beszélgetési logikát, a hangmód a teljes audiofolyamatot vizsgálja.
- Az eszköz minden LiveKit Cloud-projekt számára általánosan elérhető.
- A szolgáltatás október végéig ingyenes, a felhasznált modellek díja megmarad.
A hangügynököknél a hosszú farok okozza a gondot
A hangügynökök tesztelése nehéz, mert a valódi hívások sokféleképpen alakulhatnak. A hívó rossz kapcsolatot használhat egy parkolóban, halkan beszélhet, több részletben mondhatja be a számlaszámát, vagy megpróbálhatja rávenni az ügynököt, hogy olyasmit mondjon, amit nem szabadna.
A LiveKit szerint a legtöbb ügynököt elsősorban az úgynevezett happy pathon, vagyis az ideális forgatókönyvön tesztelik, miközben a gyártási hibák jelentős része a ritkább esetekben jelentkezik. A nyelvi modell változékonysága tovább nehezíti a helyzetet, mert ugyanarra a bemenetre sem feltétlenül ad minden alkalommal azonos választ. A kézi tesztelés, amikor a fejlesztő újra és újra felhívja a saját ügynökét, a feladatok és a támogatott nyelvek számának növekedésével nem skálázható.
A LiveKit közlése szerint a Serve AI egy teljes ügynök-újraírást száz valódi, éles környezetből származó hívással validált, mielőtt forgalmat irányított volna az új változatra.
A rendszer feladatokat és teljes beszélgetéseket vizsgál
Az Agent Simulations az Agent Simulations keretrendszerben megadott feladat szintjén tesztel. A fejlesztő leírja, mit szeretne elérni a felhasználó, az ügynök pedig a szükséges útvonalat választja ki. Ez eltér a fordulónkénti teszteléstől, amely nem tudja megfelelően visszaadni egy valódi beszélgetés kiszámíthatatlanságát.
Minden forgatókönyv a tesztcsomag része marad, így az új funkciók ellenőrzésekor a korábbi esetek is automatikusan lefuthatnak. A szolgáltatás egy nyelvi modell által vezérelt szimulált felhasználót indít el, akinek személyisége, céljai és viselkedése is megadható. Egy másik, nyelvi modellen alapuló értékelő a beszélgetés leiratát a fejlesztő által rögzített elvárások alapján minősíti, majd sikeres vagy sikertelen eredményt és annak indoklását adja.
A forgatókönyvek párhuzamosan futnak, az eredmények, a leiratok és a nyomkövetési adatok pedig a LiveKit Cloud irányítópultján jelennek meg. A LiveKit parancssori eszköze az ügynök kódjából, tényleges utasításaiból, eszközeiből és beszélgetési logikájából is képes forgatókönyveket előállítani. Ezek a generált esetek kiindulópontként szolgálnak, a fejlesztők megtarthatják, módosíthatják vagy saját forgatókönyvekkel egészíthetik ki őket.
Szöveges és hangalapú futtatás
A szöveges szimulációk megkerülik az ügynök beszédmodelljeit, ezért elsősorban a beszélgetési logikát ellenőrzik. Alapesetben ezek futnak, alacsony prioritással, a rendelkezésre álló következtetési kapacitásban. A LiveKit szerint így akár minden pull request során használhatók. Sikertelen forgatókönyvnél a parancssori eszköz nem nulla kilépési kódot ad vissza, ami a build hibáját okozza.
A hangalapú szimulációk a teljes audiofolyamatot lefedik, beleértve a háttérzajt, a megszakításokat és a közbevetett hallgatói hangokat, például az „mm-hmm” vagy „uh-huh” jelzéseket. Ezek valós időben futnak, és magasabb díjszabás mellett érhetők el, ezért a LiveKit szerint inkább éjszakai vagy kiadás előtti ellenőrzésekhez illenek.
Az Agent Simulations minden LiveKit Cloud-projekt számára általánosan elérhető. A használathoz LiveKit CLI, engedélyezett LiveKit Observability és LiveKit Cloud-projekt szükséges. A szolgáltatás október végéig ingyenes, de a szimulációk a fejlesztő valódi ügynökét futtatják, ezért a nyelvi modell, hangalapú módban pedig a beszédfelismerés és a beszédszintézis használata a szokásos díjak szerint számlázódik.
LiveKit: Testing voice agents with Agent Simulations


