A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben a medián költség feladatonként 64 százalékkal csökkent, miközben nem mértek érzékelhető minőségváltozást.
- A LangChain modellirányítója 64 százalékkal csökkentette a medián költséget.
- A vállalat nem mért érzékelhető minőségromlást a kísérletekben.
- Az Open SWE három modellkategóriából választ a feladat alapján.
- Az irányító a beszélgetés első emberi üzenetére támaszkodik.
- A fő sikermutató az összevont pull requestek száma lett.
A drága modelleket csak ott használják, ahol szükséges
A LangChain szerint az ügynökök által végzett feladatok jelentős részéhez nincs szükség a legfejlettebb, úgynevezett frontier modellekre. Egy bizonyos összetettségi szint alatt a képességesebb modell csak csekély minőségi javulást hoz, miközben a költség és a késleltetés tovább nő.
A vállalat ezt a saját havi kódolóügynök-költségeinek gyors emelkedése miatt vizsgálta, miután ügyfeleitől is hasonló problémáról hallott. Az Open SWE korábbi működésében minden feladatot egy felső kategóriás frontier modell kapott. Az új megoldás ezzel szemben a feladat alapján választ olcsóbb vagy gyorsabb modellt.
A LangChain kísérleteiben a modellirányítás a kódolási feladatok medián költségét 64 százalékkal csökkentette az alapállapothoz képest. A vállalat nem mért változást a minőségben.
A feladatok feltérképezésével kezdték
A fejlesztők először a LangSmith nyomkövetési adatait elemezték. Egy hét interaktív Open SWE-beszélgetéseit feladattípus szerint osztályozták egy nyelvi modellel, és minden beszélgetésnél vizsgálták a költséget, valamint a modellhívások számát. A csoportosításhoz LangSmith Custom Apps felületet használtak, a LangSmith Insights pedig szintén alkalmas ilyen trace-alapú elemzésre.
A legnagyobb kategóriák a funkciófejlesztések voltak 22 százalékkal és a hibajavítások 17 százalékkal. A tesztelési vagy üres futások aránya 16 százalékot tett ki. A funkciófejlesztésekhez kapcsolódó vizsgálatok jellemzően hosszabbak, drágábbak és több medián modellhívást igényeltek, míg a tesztelési és kiadási eljárásokhoz kapcsolódó beszélgetések rövidebbek és olcsóbbak voltak.
A LangChain ebből arra következtetett, hogy a feladat típusa és nehézsége már a kezdeti kérésből megbecsülhető, így sok esetben egy olcsóbb modell is elegendő lehet.
Három modell, egy döntés a beszélgetés elején
A vállalat az Artificial Analysis Intelligence Index költség- és képességadatai alapján három modellt választott ki. A gyors kategóriába a GLM-5.3-Flash (xhigh), a kiegyensúlyozott kategóriába a GPT-5.6 Sol (medium), a teljesítmény kategóriába pedig a GPT-6 Astra (low) került. A kiválasztott modellek különböző szolgáltatóktól származnak, a gyors kategóriában pedig egy nyílt modell szerepel.
Az irányító az Open SWE első emberi üzenetét olvassa el, majd a feladathoz várhatóan elegendő, legolcsóbb modellt választja. A megoldás három elemből áll: egy alaputasításból, az egyes kategóriák rövid leírásából és egy osztályozó modellből.
A döntés a LangChain middleware rétegében történik, amely az ügynök további működésének módosítása nélkül képes lecserélni a használt modellt. Az irányító jelenleg egyszer választ, a beszélgetés elején, és ugyanazt a modellt használja az egész szálon. Az első változat strukturált kimenetet használó nyelvi modellre épült, az osztályozást később a Jev döntési modellre állították át, amely a LangChain szerint közel 50-szer gyorsabbá tette ezt a lépést.
A mérés a költségcsökkentés feltétele
A LangChain szerint az irányító csak akkor hasznos, ha az olcsóbb modell mellett a feladat eredménye is megfelelő marad. Ennek vizsgálatára offline értékelést és éles A/B tesztet is lehet használni. Az offline tesztek ismételhető összehasonlítást tesznek lehetővé, de ehhez a valós forgalomhoz hasonló adatkészletre és a felhasználók számára fontos sikerkritériumokra van szükség.
Az Open SWE esetében a vállalat az összevont pull requesteket és a felhasználói visszajelzéseket követte. A rendszer rögzíti az általa megnyitott pull requesteket, valamint azt is, hogy egyesítették vagy lezárták őket. Az egy szálra jutó összevont pull request lett a fő sikermutató. Emellett pozitív és negatív értékelést is bevezettek, bár a visszajelzések ritkábbak voltak. A LangChain szerint az összevont pull requestek erősebb jelzést adtak.
A vállalat következtetése szerint a modellválasztást az ügynök úgynevezett harness rétegébe érdemes tenni, mert ez ismeri a feladatot, a használt eszközöket és a területhez kapcsolódó kontextust. Egy általános átjáró rendszerint nem rendelkezik ezekkel az információkkal.
LangChain: How to Build a Model Router in the Harness

