Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain 100-szor olcsóbb Trace Judge modellt épített

2026. augusztus 24.Forrás: LangChain
A LangChain 100-szor olcsóbb Trace Judge modellt épített
Kép: LangChain

A LangChain és a Fireworks egy Qwen-modellt finomhangolt a mesterséges intelligencia által kezelt beszélgetésekben érzékelt hibák felismerésére. A vállalat szerint a Trace Judge a határmodellnek nevezett rendszerek teljesítményét hozza, futtatása pedig akár 100-szor olcsóbb.

A lényeg röviden
  • A LangChain és a Fireworks Qwen-3.5-35B modellt finomhangolt az érzékelt hibák felismerésére.
  • A modell a felhasználói javításokból, elutasításokból és ismételt kérésekből következtet.
  • A chat-langchain adathalmazon a finomhangolt modell 96,1 százalékos pontosságot ért el.
  • A LangChain szerint a futtatási költség akár 100-szor alacsonyabb lehet.
  • A modellt először korlátozott számú ügyféllel tesztelik.

A felhasználó által érzékelt hibákat keresi

A LangSmith naponta több milliárd tokent dolgoz fel éles környezetben rögzített nyomkövetési adatokból. A LangChain szerint ezek a nyomok fontos információkat tartalmaznak arról, hogyan viselkednek az ügynöki rendszerek valódi felhasználók mellett, a nagy mennyiségű adat feldolgozása azonban költséges feladat.

A fejlesztett Trace Judge a „Perceived Error”, vagyis az érzékelt hiba felismerésére szolgál. Ez azt jelenti, hogy a rendszer azt próbálja megállapítani, a felhasználó szerint hibázott-e az asszisztens, vagy szükség volt-e a válasz kijavítására. A mérőszám nem az objektív helyességet és nem is a felhasználói elégedettséget vizsgálja.

A modell olyan jelekből következtet, mint a felhasználói javítás, egy ügynöki művelet elutasítása, a kérés megismétlése vagy az asszisztens hibát elismerő válasza. Az eredmény a nyomkövetési adatokhoz hozzáadott strukturált információ, például egy igaz vagy hamis érték és a döntést indokló rövid magyarázat.

Két eltérő adathalmazon tesztelték

A tanításhoz két, a LangChain által éles környezetben használt adathalmazból válogattak. A chat-langchain egy dokumentációs kérdés-válasz ügynök, amely a LangChain könyvtáraival és termékeivel kapcsolatos kérdésekre válaszol. A Fleet kódolás nélküli eszköz, amely dokumentumírásra és kutatásra is használható ügynökök létrehozását teszi lehetővé.

A vizsgálatba többfordulós beszélgetéseket választottak, mivel az érzékelt hiba megállapításához szükség van a mesterséges intelligencia válaszára adott emberi reakcióra. A chat-langchain adathalmaz 885, a Fleet 911 példát tartalmazott. Ezek közül rendre 707 és 727 került a tanításba, 178 és 184 pedig a visszatartott tesztkészletbe.

A címkéket modellalapú segítséggel és emberi ellenőrzéssel készítették. A chat-langchain nyomainak 24 százalékánál, a Fleet nyomainak 18 százalékánál jelöltek érzékelt hibát. A tanításhoz csak a chat-langchain adatait használták, így azt is vizsgálhatták, hogyan teljesít a modell egy másik területen.

A Qwen finomhangolása javította a pontosságot

Alapmodellként a Qwen-3.5-35B-t választották. A LangChain szerint a kisebb modellek hibaaránya magas volt, és nem tudtak elég megbízhatóan következtetni a többfordulós nyomokból. A tanítást Fireworks által kezelt, LoRA-alapú felügyelt finomhangolással végezték.

A chat-langchain adathalmazon az alap Qwen 90,5 százalékos pontosságot ért el, a chat-langchain adataival finomhangolt változat 96,1 százalékot. A Fleet tesztjén ugyanez a modell 90,8 százalékot ért el. Összehasonlításként a Claude Opus 91,6 és 90,2 százalékos, a GPT-5.5 pedig 98,9 és 89,1 százalékos eredményt hozott a két adathalmazon.

A LangChain közlése szerint a chat-langchain adataival tanított modell a Fleet adathalmazán minden vizsgált határmodellt felülmúlt. A Fleetre külön tanított változat ezen még kis mértékben javított. A vállalat szerint a finomhangolt modellek a választott modelltől és a nyomok mennyiségétől függően 10 és 100-szor olcsóbban futtathatók.

Korlátozott teszt után szélesebb bevezetés jöhet

A LangChain először néhány ügyfél számára teszi elérhetővé a finomhangolt érzékelt hiba modellt, majd egy-két hónappal később szélesebb körű bevezetést tervez. A tesztelésre jelentkezők visszajelzést adhatnak a modell működéséről.

A fejlesztők a jövőben azt is vizsgálnák, milyen hatással vannak az eredményre a kihagyott eszközhívások és a hosszú tartalmak levágása. A LangChain szerint az ilyen, költséghatékony kiértékelő modellek segíthetnek a csapatoknak jobban megérteni az ügynöki rendszerek nyomait, és megalapozottabban módosítani azokat.

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2.

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangChain eszközzel ügynökök munkafolyamataiból lehet finomhangolt modellt készíteni
Fejlesztőknek2026. szeptember 24.

A LangChain eszközzel ügynökök munkafolyamataiból lehet finomhangolt modellt készíteni

A LangChain Labs bemutatta a LangSmith Fine-Tuningot és a hozzá tartozó smithtune parancssori eszközt. A megoldás a LangSmithben tárolt ügynök-nyomokból készít…