Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain WikiBenchkel méri, mennyire segítik a wikik a kódoló ügynököket

2026. augusztus 26.Forrás: LangChain
A LangChain WikiBenchkel méri, mennyire segítik a wikik a kódoló ügynököket
Kép: LangChain

A LangChain elkészítette a WikiBench benchmarkot az OpenWiki által generált kódbázis-dokumentációk értékelésére. A rendszer azt is vizsgálja, hogy a wiki ténylegesen segíti-e a kódoló ügynököket a forráskód megértésében.

A lényeg röviden
  • A WikiBench az OpenWiki által generált kódbázis-wikiket értékeli.
  • Az ellenőrzés lefedettségi és visszakeresési kérdéseket használ.
  • A wiki és a nyers forráskód együtt adta a legmagasabb átlagos pontszámot.
  • A DeepSeek Flash nagyjából a GLM 5.2 költségének egyhatodába került.
  • A LangChain az OpenWiki fejlesztésének irányítására használja a benchmarkot.

Két kérdésre keres választ a WikiBench

A LangChain 2026. augusztus 26-án ismertette a WikiBench működését. A benchmarkot az OpenWiki fejlesztéséhez hozták létre. Az OpenWiki nyílt forráskódú ügynök, amely kódbázisok dokumentációját, vagyis wikijét állítja elő és tartja karban.

A WikiBench két szempontot mér. Egyrészt azt, hogy egy wiki segít-e a kódoló ügynököknek. Másrészt azt, hogy az OpenWiki módosításai valóban jobb minőségű dokumentációt eredményeznek-e. A rendszer a kódbázishoz kapcsolódó kérdésekkel értékeli a generált wikiket, így különböző wikiverziók minősége és hasznossága is összevethető.

A benchmark a hosszabb ideig futó ügynöki feladatok értékelésére készült Harbor keretrendszeren fut. A feladat három részből áll: a környezet biztosítja a feladat kontextusát, az ügynök végrehajtja a munkát, az ellenőrző pedig értékeli az eredményt. A WikiBench esetében a környezet egy rögzített commit alapján kicheckoutolt repository. Az ügynök ezen futtatja az OpenWiki inicializálását, majd elkészíti a kezdeti wikit.

Kérdések és több lépcsős értékelés

Az ellenőrzést egy úgynevezett olvasóügynök végzi. Ez az ügynök a wiki alapján próbál válaszolni a repositoryval kapcsolatos kérdésekre, egyes esetekben a forráskódhoz is hozzáférve, máskor csak a dokumentációt használva. Így azt mérik, hogy a wiki mennyire támogatja a valós feladatok megoldását.

A kérdések automatikusan készülnek, két típusban. A lefedettségi kérdések nagyobb tematikus területekre, például csomagokra vagy alrendszerekre vonatkoznak. Arra kérdeznek rá, hol található az adott működés a repositoryban, milyen kapcsolódó részeket kell ismerni egy módosítás előtt, és hogyan lehet ellenőrizni, hogy a változtatás nem okozott hibát.

A visszakeresési kérdések egyedi viselkedésekre koncentrálnak. A LangChain példaként egy olyan kérdést hoz, amely azt vizsgálja, mi történik, ha egy Deep Agents-futás eszközhívása túl sok kimenetet ad a kontextushoz képest, és ez hogyan különbözik attól az esettől, amikor a teljes beszélgetés növekszik túl nagyra.

Minden kérdéshez JSON-formátumú értékelési szempontlista készül, amely felsorolja az elvárt tényeket. Egy nyelvi modell ellenőrzi, hogy ezek a tények szerepelnek-e a válaszban, egy másik pedig azt vizsgálja, hogy a válaszban lévő állítások valóban azokhoz az oldalakhoz kapcsolódnak-e, amelyeket az ügynök elolvasott. A kérdés pontszáma az eltalált tények aránya, az összesített wiki-pontszám pedig az összes válasz átlagos eredménye.

A wiki útmutatóként működik a legjobban

A LangChain több ügynöki keretrendszert és modellt is tesztelt. Az első összehasonlításban a Bare DeepAgents, az OpenWiki 0.2.5 és az OpenWiki 0.3.0 szerepelt, mindegyik a Luna modellel. Az OpenWiki 0.3.0 jobb eredményt ért el korábbi verziójánál. A LangChain ezt többek között azzal magyarázza, hogy az újabb verzió nagyobb hangsúlyt helyezett a tervezésre a rendszerutasításban és egy erre kijelölt alügynök segítségével.

A javulás nagy része a lefedettségi kérdéseknél jelentkezett, miközben a visszakeresési kérdéseknél kisebb volt az előrelépés. A különböző modellek között teljesítményben, költségben és futási időben is jelentős eltéréseket mértek. A forrás szerint a DeepSeek Flash és a GLM 5.2 is jól teljesített, de eltérő költségszinten. A DeepSeek Flash nagyjából a GLM 5.2 költségének egyhatodába került. A bemutatott futások költsége 0,44 dollár és 9,18 dollár között, futási ideje pedig 11 és 50 perc között mozgott.

A WikiBench azt is összehasonlította, amikor az olvasóügynök csak a wikit, csak a nyers forráskódot, illetve mindkettőt használhatta. A wiki és a forráskód együttes használata adta a legmagasabb átlagos pontszámot, ráadásul a forrás önálló használatánál alacsonyabb költség mellett. A LangChain szerint a wiki indexként működik: kiindulópontot ad, így az ügynöknek nem kell a teljes repositoryt a nulláról rekonstruálnia. A dokumentáció önmagában gyengébben teljesített, ezért a forrás alapján inkább útmutatóként, nem a kód helyettesítőjeként hasznos.

A vállalat a WikiBenchet az OpenWiki további fejlesztésének irányítására használja. A benchmark egyszerre teszi lehetővé a wikik, az ügynöki keretrendszerek és a modellek összevetését, miközben azt is méri, hogy a dokumentáció mennyivel javítja a válaszok pontosságát és hatékonyságát.

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2.

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangSmithben is elérhető a Jev, az agentek új értékelője
Fejlesztőknek2026. szeptember 29.

A LangSmithben is elérhető a Jev, az agentek új értékelője

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez…