A LangChain 100-szor olcsóbb Trace Judge modellt épített

A LangChain és a Fireworks egy Qwen-modellt finomhangolt a mesterséges intelligencia által kezelt beszélgetésekben érzékelt hibák felismerésére. A vállalat szerint a Trace Judge a határmodellnek nevezett rendszerek teljesítményét hozza, futtatása pedig akár 100-szor olcsóbb.
- A LangChain és a Fireworks Qwen-3.5-35B modellt finomhangolt az érzékelt hibák felismerésére.
- A modell a felhasználói javításokból, elutasításokból és ismételt kérésekből következtet.
- A chat-langchain adathalmazon a finomhangolt modell 96,1 százalékos pontosságot ért el.
- A LangChain szerint a futtatási költség akár 100-szor alacsonyabb lehet.
- A modellt először korlátozott számú ügyféllel tesztelik.
A felhasználó által érzékelt hibákat keresi
A LangSmith naponta több milliárd tokent dolgoz fel éles környezetben rögzített nyomkövetési adatokból. A LangChain szerint ezek a nyomok fontos információkat tartalmaznak arról, hogyan viselkednek az ügynöki rendszerek valódi felhasználók mellett, a nagy mennyiségű adat feldolgozása azonban költséges feladat.
A fejlesztett Trace Judge a „Perceived Error”, vagyis az érzékelt hiba felismerésére szolgál. Ez azt jelenti, hogy a rendszer azt próbálja megállapítani, a felhasználó szerint hibázott-e az asszisztens, vagy szükség volt-e a válasz kijavítására. A mérőszám nem az objektív helyességet és nem is a felhasználói elégedettséget vizsgálja.
A modell olyan jelekből következtet, mint a felhasználói javítás, egy ügynöki művelet elutasítása, a kérés megismétlése vagy az asszisztens hibát elismerő válasza. Az eredmény a nyomkövetési adatokhoz hozzáadott strukturált információ, például egy igaz vagy hamis érték és a döntést indokló rövid magyarázat.
Két eltérő adathalmazon tesztelték
A tanításhoz két, a LangChain által éles környezetben használt adathalmazból válogattak. A chat-langchain egy dokumentációs kérdés-válasz ügynök, amely a LangChain könyvtáraival és termékeivel kapcsolatos kérdésekre válaszol. A Fleet kódolás nélküli eszköz, amely dokumentumírásra és kutatásra is használható ügynökök létrehozását teszi lehetővé.
A vizsgálatba többfordulós beszélgetéseket választottak, mivel az érzékelt hiba megállapításához szükség van a mesterséges intelligencia válaszára adott emberi reakcióra. A chat-langchain adathalmaz 885, a Fleet 911 példát tartalmazott. Ezek közül rendre 707 és 727 került a tanításba, 178 és 184 pedig a visszatartott tesztkészletbe.
A címkéket modellalapú segítséggel és emberi ellenőrzéssel készítették. A chat-langchain nyomainak 24 százalékánál, a Fleet nyomainak 18 százalékánál jelöltek érzékelt hibát. A tanításhoz csak a chat-langchain adatait használták, így azt is vizsgálhatták, hogyan teljesít a modell egy másik területen.
A Qwen finomhangolása javította a pontosságot
Alapmodellként a Qwen-3.5-35B-t választották. A LangChain szerint a kisebb modellek hibaaránya magas volt, és nem tudtak elég megbízhatóan következtetni a többfordulós nyomokból. A tanítást Fireworks által kezelt, LoRA-alapú felügyelt finomhangolással végezték.
A chat-langchain adathalmazon az alap Qwen 90,5 százalékos pontosságot ért el, a chat-langchain adataival finomhangolt változat 96,1 százalékot. A Fleet tesztjén ugyanez a modell 90,8 százalékot ért el. Összehasonlításként a Claude Opus 91,6 és 90,2 százalékos, a GPT-5.5 pedig 98,9 és 89,1 százalékos eredményt hozott a két adathalmazon.
A LangChain közlése szerint a chat-langchain adataival tanított modell a Fleet adathalmazán minden vizsgált határmodellt felülmúlt. A Fleetre külön tanított változat ezen még kis mértékben javított. A vállalat szerint a finomhangolt modellek a választott modelltől és a nyomok mennyiségétől függően 10 és 100-szor olcsóbban futtathatók.
Korlátozott teszt után szélesebb bevezetés jöhet
A LangChain először néhány ügyfél számára teszi elérhetővé a finomhangolt érzékelt hiba modellt, majd egy-két hónappal később szélesebb körű bevezetést tervez. A tesztelésre jelentkezők visszajelzést adhatnak a modell működéséről.
A fejlesztők a jövőben azt is vizsgálnák, milyen hatással vannak az eredményre a kihagyott eszközhívások és a hosszú tartalmak levágása. A LangChain szerint az ilyen, költséghatékony kiértékelő modellek segíthetnek a csapatoknak jobban megérteni az ügynöki rendszerek nyomait, és megalapozottabban módosítani azokat.
LangChain: Building a 100x Cheaper Trace Judge with Fireworks


