Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A LangChain nyílt forrású eszközzel teszteli az LLM-es kérdésválaszolást

2026. augusztus 26.Forrás: LangChain
A LangChain nyílt forrású eszközzel teszteli az LLM-es kérdésválaszolást
Kép: LangChain

A LangChain nyílt forrású, ingyenesen használható alkalmazást és API-t tett elérhetővé LLM-alapú kérdésválaszoló rendszerek tesztelésére. Az eszköz dokumentumok alapján kérdés-válasz tesztkészletet generál, majd automatikusan értékeli a felhasználó által beállított lánc válaszait.

A lényeg röviden
  • A LangChain nyílt forrású, ingyenes auto-evaluator alkalmazást és API-t adott ki.
  • Az eszköz dokumentumokból kérdés-válasz tesztkészletet generál.
  • A felhasználó több kérdésválaszoló lánc eredményét hasonlíthatja össze.
  • A TF-IDF és az SVM egy tesztben a k legközelebbi szomszéd módszerével összemérhető eredményt adott.
  • A pontozás eredménye a használt prompttól és modelltől is változhat.

Automatikusan készül a tesztkészlet

A LangChain kérdésválaszolásra alkalmas láncok összeállítását segíti. A folyamatban a bemeneti dokumentumokat kisebb részekre bontják, ezeket egy lekérdező rendszerben tárolják, majd a felhasználó kérdéséhez kapcsolódó részeket egy nyelvi modell kapja meg válaszgenerálásra.

A LangChain szerint az ilyen rendszerek minősége jelentősen változhat. A válaszokat befolyásolhatják például a paraméterbeállítások, és előfordulhat hallucináció vagy gyenge válaszminőség. Gyakran az sem egyértelmű, hogyan kell megmérni a válaszokat, illetve hogyan lehet az eredmények alapján módosítani a lánc beállításait, a felhasznált dokumentumok számát, a darabolás méretét, a modellt vagy a lekérdezőt.

Az auto-evaluator ezeket a lépéseket egy munkafelületen kapcsolja össze. A megadott dokumentumból automatikusan kérdés-válasz párokat állít elő, majd egy modell segítségével pontozza a kérdésválaszoló lánc eredményeit. A megközelítés a LangChain leírása szerint az Anthropic modell által írt értékelési adathalmazokra épülő munkáját és az OpenAI modellalapú értékelését ötvözi.

Demo és saját dokumentumokkal működő játszótér

A szolgáltatás két módon használható. A demóban előre betöltöttek egy Lex Fridman podcastátiratot, amelyben Andrej Karpathy szerepel, valamint öt, a beszélgetéshez kapcsolódó kérdés-válasz párt. A felhasználó különböző kérdésválaszoló láncokat állíthat be, majd összehasonlíthatja a teljesítményüket.

A játszótérben saját dokumentum adható meg több lánc értékeléséhez. A felhasználó opcionálisan előre elkészített kérdés-válasz párokat is hozzáadhat a dokumentumhoz. A LangChain közleménye szerint az alkalmazás és az API nyílt forrású, használatuk ingyenes.

A visszakeresés és az értékelés is fejleszthető

A LangChain több fejlesztési lehetőséget is felsorol. Az egyik a fájlkezelés: két, összesen 39 MB-os fájl feltöltése a produkciós környezetben körülbelül 40 másodpercet vett igénybe, miközben helyi környezetben az átviteli idő nulla másodperc volt. A cég szerint a képek növelik a fájlméretet, ezért azok eltávolítása gyorsíthatná a feltöltést.

A kérdés-válasz párok generálása jelenleg véletlenszerűen kiválasztott részletekből történik, elsősorban a sebesség érdekében. A LangChain szerint ezt javítani lehetne úgy, hogy a kérdések a teljes bemeneti szöveg összefüggéseit is figyelembe vegyék.

A dokumentumok visszakeresésére használt módszerek között a vektortárolók beágyazásain alapuló k legközelebbi szomszéd keresése mellett a cég az SVM-et és a TF-IDF-et is vizsgálta. Egy, 15 tanulmányból álló tesztkészletben a TF-IDF és az SVM legalább olyan jól teljesített, sőt kissé jobban, mint a k legközelebbi szomszéd módszer. A LangChain hangsúlyozza, hogy ez az eredmény az adott esethez kötődik.

A pontozó modell válaszai sem mindig stabilak

Az értékeléshez használt utasítás, vagyis prompt, jelentősen befolyásolta a pontszámokat. A LangChain tesztjében a gyors prompt 5-ből 5, a leíró prompt 4-ből 5, a torzítással kiegészített leíró prompt 5-ből 5 választ értékelt helyesnek. Az OpenAI zárt kérdésválaszolási értékeléshez használt promptja 2-ből 5 eredményt adott.

Az alkalmazás jelenleg GPT-3.5-turbót használ értékelőként, miközben az OpenAI-val folytatott egyeztetés alapján a GPT4 előnyösebb lehet. A LangChain egy olyan példát is bemutatott, amelyben ugyanazt a választ a rendszer egyszer hibásnak, máskor helyesnek minősítette, egy kettős tagadás miatt.

A fejlesztők a fájlkezeléshez, a kérdésgeneráláshoz és pontozáshoz használt promptokhoz, az értékelő modellekhez, valamint a lekérdezőkhöz várnak hozzájárulásokat. A közlemény szerint ezek jelentik a fejlesztés legnagyobb hatású területeit.

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2.

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

Jev csak igennel vagy nemmel válaszol, és olcsóbb AI-döntéseket céloz
Modellek2026. szeptember 24.

Jev csak igennel vagy nemmel válaszol, és olcsóbb AI-döntéseket céloz

A TypeSafe olyan AI-modellt készített, amely nem beszélgetésre vagy szövegírásra szolgál, hanem szűk üzleti kérdésekre válaszol igennel vagy nemmel. A Jev a válasz…

A Snowflake az AI-ügynökök megfigyelhetőségét készíti elő
Fejlesztőknek2026. szeptember 22.

A Snowflake az AI-ügynökök megfigyelhetőségét készíti elő

A Snowflake az AI-ügynökök és nagy nyelvi modellekre épülő alkalmazások megfigyelésére készít új funkciót az Observe platformon. Az Agent Observability a működés…