A Langfuse Jevvel egyszerre több jelet keres a beszélgetésekben

A Langfuse új, Jev-alapú kiértékelősablont kínál a chatügynökök beszélgetéseinek elemzésére. A rendszer egyetlen menetben több beszélgetési jelet is vizsgálhat, így a vállalat szerint a teljes gyártási forgalom ellenőrizhető az LLM-as-a-judge megközelítés költségének töredékéért.
- A Langfuse Jev-alapú sablont kínál a chatbeszélgetések értékelésére.
- Egy menetben több beszélgetési jel, például frusztráció és visszakérdezés vizsgálható.
- A vállalat szerint a teljes gyártási forgalom elemezhető az LLM-as-a-judge költségének töredékéért.
- Az eredmények beérkező és korábbi nyomokon is megjeleníthetők.
- A jelek irányítópultokon és mentett nézetekben is ábrázolhatók.
A beszélgetési jelek a problémás interakciókra irányítják a figyelmet
A chatügynökök naponta több millió felhasználói interakciót kezelhetnek, ezt a mennyiséget emberi erővel már nem lehet manuálisan átnézni. A Langfuse szerint a Jevhez hasonló modellek lehetőséget adnak arra, hogy a működés közben keletkező nyomokat, vagyis a production trace-eket, nagy léptékben vizsgálják a hibákra utaló jelek után.
A szolgáltatás négyféle felhasználói jel elkülönítését említi. Az explicit visszajelzés lehet például a pozitív vagy negatív értékelés, a viselkedési jel egy beszélgetés bezárása, a kimeneti jel pedig egy teljesített foglalás. A beszélgetési jelek közé tartozhat, ha a felhasználó frusztrált, javítja az AI válaszát, vagy további kérdést tesz fel.
A Langfuse szerint ezek a jelek segítenek kiválasztani azokat a gyártási beszélgetéseket, amelyek manuális ellenőrzése a nagy volumen miatt már nem megoldható. A jelek azt mutathatják, hogy valami hibásan működik az interakcióban.
Egy menetben több értékelés futhat
A korábbi, elterjedt megközelítések elsősorban az LLM-as-a-judge módszerre épültek. A nagyobb léptékű használat költségeit jellemzően mintavételezéssel próbálták kordában tartani. A Langfuse közleménye szerint a Jevhez hasonló modellek ezzel szemben lehetővé teszik az összes gyártási nyom teljes körű vizsgálatát.
Ennek egyik előnye, hogy ugyanaz az állapot vagy kontextus több kérdés megválaszolásához is újra felhasználható párhuzamosan. Egy beszélgetés így egyszerre értékelhető abból a szempontból, hogy a felhasználó tett-e fel újabb kérdést, frusztrált volt-e, ellentmondott-e az ügynöknek, illetve elégedettnek tűnik-e az eredménnyel.
A Langfuse példája egy repülőjegy-újrafoglalást bemutató ügyfélszolgálati beszélgetés. A felhasználónak először javítania kell az AI-t, később további kérdést tesz fel, végül azonban sikerül megoldani a kérését. A beszélgetés kimenetele tehát sikeres, miközben az ügynök kezdetben hibázott, és a válaszai nem voltak elég hatékonyak ahhoz, hogy elkerüljék a további kérdést.
A különböző dimenziók külön kérdésként modellezhetők, így az értékelés külön eredményeket adhat az egyes beszélgetési jelekről. A Langfuse szerint ez a folyamat a csúcskategóriás LLM-ek használatához képest az értékelési költség töredékébe kerülhet.
A sablon a Langfuse kiértékelőiben érhető el
A Langfuse sablongalériájába egy teljes, Jev-alapú kötegelt kiértékelősablon került a gyártási jelek felismerésére. A beállításhoz a felhasználónak az Evaluator lapot kell megnyitnia, majd a New evaluator lehetőséget választania.
Ezután a User Conversation Signal sablont kell kiválasztani, hozzá kell adni a Jev-kapcsolatot, majd meg kell jelölni és tesztelni azokat a megfigyeléseket, amelyeken a kiértékelés fusson. A mentés után szabály állítható be a kiértékelők futtatására, az eredmények pedig megjelennek a beérkező nyomokon.
A rendszer korábbi nyomok utólagos vizsgálatát is támogatja. Az eredmények megjelenítéséhez a felhasználók irányítópultokat és mentett nézeteket hozhatnak létre a nyomkövetési táblában.
A felhasználók teljesebb képet kaphatnak az ügynökök működéséről
A Langfuse szerint a beszélgetési jelek rögzítése általánosan használható, miközben az értékeléseket az adott alkalmazáshoz kell igazítani. A vállalat nyílt forráskódú megfigyelhetőségi platformként kínálja a megoldást, amelyet csapatok LLM-alkalmazások fejlesztésére használnak.
Az új sablon lehetővé teszi, hogy a felhasználók egy sikeresen lezárt beszélgetés mögött is lássák a javításokat, a frusztrációt vagy a visszakérdezéseket. Így a végső eredmény mellett azok a pontok is megjelenhetnek, ahol az AI válasza további munkát okozott a felhasználónak.
Langfuse: Catching conversation signals in Langfuse - Langfuse


