A LangChain eszközzel ügynökök munkafolyamataiból lehet finomhangolt modellt készíteni

A LangChain Labs bemutatta a LangSmith Fine-Tuningot és a hozzá tartozó smithtune parancssori eszközt. A megoldás a LangSmithben tárolt ügynök-nyomokból készít tanítóadatot, elindítja a finomhangolást, majd kiértékeli az eredményt.
- A smithtune LangSmith-nyomokból készít finomhangolási adatállományt.
- A tanítás Fireworks vagy Baseten infrastruktúráján futtatható.
- Az eszköz a finomhangolt és az alapmodellt is összehasonlítja.
- A LangChain egyik tesztjében az F1-érték 48,9 százalékról 53,7 százalékra nőtt.
- A kiválasztott modell a smithtune deploy paranccsal szolgálatba állítható.
Egy folyamatba szervezi az adat-előkészítést és a tanítást
A szeptember 24-én közzétett bejelentés szerint a smithtune egyetlen parancssori felületen kezeli a finomhangolás fő lépéseit. A LangSmith nyomkövetési adataiból létrehozza és előkészíti az adatállományt, a tanítást a Fireworks vagy a Baseten szolgáltatásán indítja el, majd az értékelési eredményeket visszatölti a LangSmithbe.
A folyamat közvetlenül a smithtune használatával vagy kódoló ügynök bevonásával is futtatható. A LangChain szerint a cél, hogy a csapatok saját ügynökeikhez specializált modelleket készíthessenek anélkül, hogy kézzel kellene felépíteniük a teljes adatfeldolgozási folyamatot.
A smithtune jelenleg felügyelt finomhangolást, vagyis SFT-t támogat. Ennek során a modell jó viselkedést bemutató bemenetekből és kimenetekből tanul, a modellparaméterek módosításával utánozva ezeket a példákat.
A LangSmith nyomai adják a tanítás alapját
A LangChain meghatározása szerint egy ügynök-nyom az üzenetek, eszközhívások és eszközválaszok rendezett sorozata, amely megmutatja, hogyan oldott meg az ügynök egy feladatot. A LangSmith ezt a sorozatot egy nyomból vagy szálból állítja össze, egységesíti a támogatott üzenetformátumokat, megőrzi az eszközdefiníciókat, és eltávolítja a megkettőzött előzményeket.
Ez azért fontos a felügyelt finomhangolásnál, mert a tanuló modellnek ugyanazt a kontextust kell látnia, amely a jó eredményt előállító modell rendelkezésére állt. Hosszú és összetett ügynökfolyamatokban az elérhető eszközök köre menet közben változhat, ezért egy egyszerű, végső üzenetlista nem feltétlenül őrzi meg ezt az információt. A LangSmith pályaformátuma minden lépésnél rögzíti, mit látott a modell.
A smithtune először a LangSmith projektjéből helyi könyvtárba tölti a nyomokat, amelyeket szűrők alapján lehet kiválasztani. Emberek és ügynökök közösen azonosíthatják a jó példákat, majd egy értékelési szempontsort használva szűrhetik a finomhangolásra alkalmas nyomokat. A kiválasztott, úgynevezett aranypéldákat a rendszer tartós LangSmith-adatállományként menti, így a tanítóadat később ellenőrizhető marad.
Az eszköz a modellhez túl hosszú nyomokat kiszűri, valamint elkülöníti a tanító-, validációs és tesztadatokat.
Kiértékelés, telepítés és a LangChain tesztjei
A tanítás előtt a smithtune plan segítségével áttekinthetők a kiválasztott modell, a példák száma és a hiperparaméterek, például a tanulási ráta, a kötegméret és a korszakok száma. Ezután a smithtune train indítja el a feladatot a Fireworks felügyelt SFT-szolgáltatásán vagy a Baseten Loops rendszerén. Mindkét megoldás támogatja a LoRA-alapú tanítást, a GPU-k és a tanítási infrastruktúra kezelését pedig a szolgáltatók végzik.
A tanítás során a rendszer a validációs adaton is ellenőrzi a teljesítményt, és a legalacsonyabb validációs veszteséget elérő mentett ellenőrzőpontot választja ki. A smithtune evaluate ezt az ellenőrzőpontot összeveti az alapmodellel. A beépített visszajátszásos értékelés azt vizsgálja, hogy a modellek képesek-e végrehajtani az aranynyomokban rögzített műveleteket, a jóslatokat pedig értékelő rendszer pontozza.
Az eredmények LangSmith-összehasonlító linken jelennek meg. A felhasználók megvizsgálhatják az egyes válaszokat és eszközválasztásokat, valamint azt is, hol javított a finomhangolás, illetve hol okozott visszaesést. Megfelelő eredmény esetén a smithtune deploy szolgálatba állítja a modellt, gyengébb eredménynél pedig az adatállomány vagy a tanítási beállítások módosítása után újraindítható a folyamat.
A LangChain két saját ügynökön vizsgálta a módszert. Az Engine esetében a finomhangolt Kimi K3 az IssueBench egy részhalmazán 96,0 pontos feladatpontszámot ért el, szemben az alap Kimi K3 90,0 és a GPT-5.6 Sol 87,0 pontjával. Az OpenSWE Review tesztjében a Qwen-3.8-27B F1-értéke 48,9 százalékról 53,7 százalékra nőtt, miközben a modellhívások száma 29,8 százalékkal, az eszközkéréseké 29,4 százalékkal csökkent.
A közlemény szerint egy korábbi, kevésbé szelektív tanítóadat-állomány az SFT után rontotta az F1-értéket. A LangChain ezért továbbfejlesztette az adatválogatási folyamatot, és minden nyomathoz külön felülvizsgálati lépést adott hozzá.
LangChain: Introducing LangSmith Fine-Tuning


