Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

2026. október 2. 15:31Forrás: LangChain
A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Kép: LangChain

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben a medián költség feladatonként 64 százalékkal csökkent, miközben nem mértek érzékelhető minőségváltozást.

A lényeg röviden
  • A LangChain modellirányítója 64 százalékkal csökkentette a medián költséget.
  • A vállalat nem mért érzékelhető minőségromlást a kísérletekben.
  • Az Open SWE három modellkategóriából választ a feladat alapján.
  • Az irányító a beszélgetés első emberi üzenetére támaszkodik.
  • A fő sikermutató az összevont pull requestek száma lett.

A drága modelleket csak ott használják, ahol szükséges

A LangChain szerint az ügynökök által végzett feladatok jelentős részéhez nincs szükség a legfejlettebb, úgynevezett frontier modellekre. Egy bizonyos összetettségi szint alatt a képességesebb modell csak csekély minőségi javulást hoz, miközben a költség és a késleltetés tovább nő.

A vállalat ezt a saját havi kódolóügynök-költségeinek gyors emelkedése miatt vizsgálta, miután ügyfeleitől is hasonló problémáról hallott. Az Open SWE korábbi működésében minden feladatot egy felső kategóriás frontier modell kapott. Az új megoldás ezzel szemben a feladat alapján választ olcsóbb vagy gyorsabb modellt.

A LangChain kísérleteiben a modellirányítás a kódolási feladatok medián költségét 64 százalékkal csökkentette az alapállapothoz képest. A vállalat nem mért változást a minőségben.

A feladatok feltérképezésével kezdték

A fejlesztők először a LangSmith nyomkövetési adatait elemezték. Egy hét interaktív Open SWE-beszélgetéseit feladattípus szerint osztályozták egy nyelvi modellel, és minden beszélgetésnél vizsgálták a költséget, valamint a modellhívások számát. A csoportosításhoz LangSmith Custom Apps felületet használtak, a LangSmith Insights pedig szintén alkalmas ilyen trace-alapú elemzésre.

A legnagyobb kategóriák a funkciófejlesztések voltak 22 százalékkal és a hibajavítások 17 százalékkal. A tesztelési vagy üres futások aránya 16 százalékot tett ki. A funkciófejlesztésekhez kapcsolódó vizsgálatok jellemzően hosszabbak, drágábbak és több medián modellhívást igényeltek, míg a tesztelési és kiadási eljárásokhoz kapcsolódó beszélgetések rövidebbek és olcsóbbak voltak.

A LangChain ebből arra következtetett, hogy a feladat típusa és nehézsége már a kezdeti kérésből megbecsülhető, így sok esetben egy olcsóbb modell is elegendő lehet.

Három modell, egy döntés a beszélgetés elején

A vállalat az Artificial Analysis Intelligence Index költség- és képességadatai alapján három modellt választott ki. A gyors kategóriába a GLM-5.3-Flash (xhigh), a kiegyensúlyozott kategóriába a GPT-5.6 Sol (medium), a teljesítmény kategóriába pedig a GPT-6 Astra (low) került. A kiválasztott modellek különböző szolgáltatóktól származnak, a gyors kategóriában pedig egy nyílt modell szerepel.

Az irányító az Open SWE első emberi üzenetét olvassa el, majd a feladathoz várhatóan elegendő, legolcsóbb modellt választja. A megoldás három elemből áll: egy alaputasításból, az egyes kategóriák rövid leírásából és egy osztályozó modellből.

A döntés a LangChain middleware rétegében történik, amely az ügynök további működésének módosítása nélkül képes lecserélni a használt modellt. Az irányító jelenleg egyszer választ, a beszélgetés elején, és ugyanazt a modellt használja az egész szálon. Az első változat strukturált kimenetet használó nyelvi modellre épült, az osztályozást később a Jev döntési modellre állították át, amely a LangChain szerint közel 50-szer gyorsabbá tette ezt a lépést.

A mérés a költségcsökkentés feltétele

A LangChain szerint az irányító csak akkor hasznos, ha az olcsóbb modell mellett a feladat eredménye is megfelelő marad. Ennek vizsgálatára offline értékelést és éles A/B tesztet is lehet használni. Az offline tesztek ismételhető összehasonlítást tesznek lehetővé, de ehhez a valós forgalomhoz hasonló adatkészletre és a felhasználók számára fontos sikerkritériumokra van szükség.

Az Open SWE esetében a vállalat az összevont pull requesteket és a felhasználói visszajelzéseket követte. A rendszer rögzíti az általa megnyitott pull requesteket, valamint azt is, hogy egyesítették vagy lezárták őket. Az egy szálra jutó összevont pull request lett a fő sikermutató. Emellett pozitív és negatív értékelést is bevezettek, bár a visszajelzések ritkábbak voltak. A LangChain szerint az összevont pull requestek erősebb jelzést adtak.

A vállalat következtetése szerint a modellválasztást az ügynök úgynevezett harness rétegébe érdemes tenni, mert ez ismeri a feladatot, a használt eszközöket és a területhez kapcsolódó kontextust. Egy általános átjáró rendszerint nem rendelkezik ezekkel az információkkal.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

ModellekFontos hír
Modellek2026. október 2. 18:15

Az OpenAI útmutatót adott ki a GPT-6 modellek használatához

Az OpenAI gyakorlati útmutatóban mutatja be, hogyan érdemes kiválasztani és használni a GPT-6 család modelljeit. A dokumentum a fejlesztési feladatoktól a több napon át…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 30. 01:10

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangSmithben is elérhető a Jev, az agentek új értékelője
Fejlesztőknek2026. szeptember 30. 01:10

A LangSmithben is elérhető a Jev, az agentek új értékelője

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez…