A LangChain automatikus értékelőt indított az AI-ügynökök hibáinak felismerésére

A LangChain bemutatta a LangSmith Tuned Evaluators szolgáltatást, amely automatikusan minőségi visszajelzést kapcsol a gyártásban futó AI-ügynökök nyomkövetéseihez. Az első értékelő a Perceived Error, amely az ügynökök hibáira és a felhasználói igények félreértésére próbál következtetni.
- A LangChain bemutatta a LangSmith Tuned Evaluators szolgáltatást.
- Az első értékelő, a Perceived Error, az AI-ügynökök beszélgetési hibáit keresi.
- A LangChain szerint a speciális modell 82 százalékkal csökkenti az értékelés költségét.
- Az értékelés a jogosult beszélgetésekhez 12 órán belül elkészül.
- A szolgáltatás jelenleg az amerikai Plus és Cloud Enterprise csomagokban érhető el.
Automatikus ellenőrzés a gyártási beszélgetésekben
A LangChain augusztus 18-án jelentette be a Tuned Evaluators szolgáltatást. Ezek kész, verziózott értékelők egy-egy meghatározott célra. A csapatok kiválaszthatják a számukra szükséges értékelőt, majd hozzárendelhetik egy LangSmith nyomkövetési projekthez.
A rendszer az értékelő követelményei alapján azonosítja a vizsgálható nyomkövetéseket vagy beszélgetési szálakat. Egy, a LangChain által kezelt speciális modell értékeli ezeket, az eredményt és annak magyarázatát pedig visszajelzésként hozzákapcsolja az eredeti interakcióhoz.
A LangChain szerint a csapatoknak így nem kell összetett utasításokat írniuk és karbantartaniuk, értékelőként használt nyelvi modelleket kiválasztaniuk vagy verziózniuk, illetve hitelesítő adatokat és következtetési infrastruktúrát kezelniük. A szolgáltató ezeket a feladatokat végponttól végpontig elvégzi.
A Perceived Error a rejtett hibákat is keresi
Az első Tuned Evaluator, a Perceived Error olyan beszélgetéseket azonosít, amelyek arra utalnak, hogy az AI-ügynök hibázott, félreértette a kérést, vagy rossz irányba vitte az interakciót. A jelek lehetnek közvetlenek, például felhasználói javítás, ismételt kérés vagy elutasított művelet.
A modell következtethet a problémára ellentmondó válaszokból, elismert hibákból, tartós félreértésekből és lezáratlan eredményekből is. A LangChain szerint ez hasznos közelítő jelzés arra, hogy az ügynök megfelel-e a felhasználó igényeinek, mivel a legtöbb felhasználó nem ad külön értékelést.
A vállalat beszélgetési ügynökök címkézett nyomkövetésein utólag tanított be egy speciális modellt. A LangChain állítása szerint a modell a saját tesztjükben minden élvonalbeli modellnél jobb eredményt ért el, miközben az értékelés költségét 82 százalékkal csökkentette. Egyes korai partneri felhasználásoknál a megtakarítás elérte a 98 százalékot, a költség eltérése azonban a beszélgetési szálak összetételétől függ.
Mire használhatják a csapatok?
A visszajelzésekkel a fejlesztők megtalálhatják azokat a hibákat, amelyek nem okoztak rendszerhibát, és nem jártak együtt kifejezett felhasználói értékeléssel sem. A megjelölt beszélgetéseket kivizsgálhatják, az értékelő magyarázatát összevethetik az eredeti interakcióval, majd ismétlődő hibamintákat kereshetnek.
A kiválasztott nyomkövetésekből értékelési adathalmazokat építhetnek, a bizonytalan eseteket pedig emberi felülvizsgálatra irányíthatják. Ezeket a példákat később az ügynök módosításainak tesztelésére és ellenőrzésére használhatják. A LangChain szerint az eredmények elemzési, kódolóügynökös, CI, emberi felülvizsgálati és értékelési folyamatokba is beilleszthetők.
A Perceived Error akkor válik elérhetővé egy beszélgetési szálhoz, ha legalább két emberi és AI-üzenetpárt tartalmaz, valamint letelik a beállított várakozási idő. Az értékelés a jogosultság elérése után 12 órán belül elkészül.
A szolgáltatás jelenleg az Egyesült Államokban, a LangSmith Plus és Cloud Enterprise csomagokban érhető el. Minden sikeres értékelés után külön tuned evaluation díjat számítanak fel, a kihagyott és sikertelen értékelésekért nem kell fizetni. A LangChain szerint a Perceived Error használatával a csapatok azonnal minőségi lefedettséget kaphatnak, miközben saját, üzletspecifikus értékelőiket fejlesztik.
LangChain: Introducing LangSmith Tuned Evaluators


