Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain automatikus értékelőt indított az AI-ügynökök hibáinak felismerésére

2026. augusztus 19.Forrás: LangChain
A LangChain automatikus értékelőt indított az AI-ügynökök hibáinak felismerésére
Kép: LangChain

A LangChain bemutatta a LangSmith Tuned Evaluators szolgáltatást, amely automatikusan minőségi visszajelzést kapcsol a gyártásban futó AI-ügynökök nyomkövetéseihez. Az első értékelő a Perceived Error, amely az ügynökök hibáira és a felhasználói igények félreértésére próbál következtetni.

A lényeg röviden
  • A LangChain bemutatta a LangSmith Tuned Evaluators szolgáltatást.
  • Az első értékelő, a Perceived Error, az AI-ügynökök beszélgetési hibáit keresi.
  • A LangChain szerint a speciális modell 82 százalékkal csökkenti az értékelés költségét.
  • Az értékelés a jogosult beszélgetésekhez 12 órán belül elkészül.
  • A szolgáltatás jelenleg az amerikai Plus és Cloud Enterprise csomagokban érhető el.

Automatikus ellenőrzés a gyártási beszélgetésekben

A LangChain augusztus 18-án jelentette be a Tuned Evaluators szolgáltatást. Ezek kész, verziózott értékelők egy-egy meghatározott célra. A csapatok kiválaszthatják a számukra szükséges értékelőt, majd hozzárendelhetik egy LangSmith nyomkövetési projekthez.

A rendszer az értékelő követelményei alapján azonosítja a vizsgálható nyomkövetéseket vagy beszélgetési szálakat. Egy, a LangChain által kezelt speciális modell értékeli ezeket, az eredményt és annak magyarázatát pedig visszajelzésként hozzákapcsolja az eredeti interakcióhoz.

A LangChain szerint a csapatoknak így nem kell összetett utasításokat írniuk és karbantartaniuk, értékelőként használt nyelvi modelleket kiválasztaniuk vagy verziózniuk, illetve hitelesítő adatokat és következtetési infrastruktúrát kezelniük. A szolgáltató ezeket a feladatokat végponttól végpontig elvégzi.

A Perceived Error a rejtett hibákat is keresi

Az első Tuned Evaluator, a Perceived Error olyan beszélgetéseket azonosít, amelyek arra utalnak, hogy az AI-ügynök hibázott, félreértette a kérést, vagy rossz irányba vitte az interakciót. A jelek lehetnek közvetlenek, például felhasználói javítás, ismételt kérés vagy elutasított művelet.

A modell következtethet a problémára ellentmondó válaszokból, elismert hibákból, tartós félreértésekből és lezáratlan eredményekből is. A LangChain szerint ez hasznos közelítő jelzés arra, hogy az ügynök megfelel-e a felhasználó igényeinek, mivel a legtöbb felhasználó nem ad külön értékelést.

A vállalat beszélgetési ügynökök címkézett nyomkövetésein utólag tanított be egy speciális modellt. A LangChain állítása szerint a modell a saját tesztjükben minden élvonalbeli modellnél jobb eredményt ért el, miközben az értékelés költségét 82 százalékkal csökkentette. Egyes korai partneri felhasználásoknál a megtakarítás elérte a 98 százalékot, a költség eltérése azonban a beszélgetési szálak összetételétől függ.

Mire használhatják a csapatok?

A visszajelzésekkel a fejlesztők megtalálhatják azokat a hibákat, amelyek nem okoztak rendszerhibát, és nem jártak együtt kifejezett felhasználói értékeléssel sem. A megjelölt beszélgetéseket kivizsgálhatják, az értékelő magyarázatát összevethetik az eredeti interakcióval, majd ismétlődő hibamintákat kereshetnek.

A kiválasztott nyomkövetésekből értékelési adathalmazokat építhetnek, a bizonytalan eseteket pedig emberi felülvizsgálatra irányíthatják. Ezeket a példákat később az ügynök módosításainak tesztelésére és ellenőrzésére használhatják. A LangChain szerint az eredmények elemzési, kódolóügynökös, CI, emberi felülvizsgálati és értékelési folyamatokba is beilleszthetők.

A Perceived Error akkor válik elérhetővé egy beszélgetési szálhoz, ha legalább két emberi és AI-üzenetpárt tartalmaz, valamint letelik a beállított várakozási idő. Az értékelés a jogosultság elérése után 12 órán belül elkészül.

A szolgáltatás jelenleg az Egyesült Államokban, a LangSmith Plus és Cloud Enterprise csomagokban érhető el. Minden sikeres értékelés után külön tuned evaluation díjat számítanak fel, a kihagyott és sikertelen értékelésekért nem kell fizetni. A LangChain szerint a Perceived Error használatával a csapatok azonnal minőségi lefedettséget kaphatnak, miközben saját, üzletspecifikus értékelőiket fejlesztik.

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2.

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangSmithben is elérhető a Jev, az agentek új értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az agentek új értékelője

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez…