A LangChain egyszerűbb módszert választott a webes kutatás automatizálására
A LangChain egy webes kutatásra szánt, testre szabható retrievert mutatott be, amely több keresést indít párhuzamosan, majd a releváns információkat egy nyelvi modell segítségével dolgozza fel. A fejlesztők eredetileg autonóm kutatóügynököt építettek volna, de kísérleteik során egyszerűbb megközelítésre váltottak.
- A LangChain autonóm webes kutatóügynök helyett retrievert fejlesztett.
- A rendszer több keresést és weboldal-letöltést futtat párhuzamosan.
- A releváns dokumentumrészleteket nyelvi modell használja fel a válasz összeállításához.
- A megoldás helyben is futtatható, és tetszőleges komponensekkel konfigurálható.
- A LangChain később további ügynöki képességeket adna hozzá.
Az autonóm ügynök helyett retriever lett a projektből
A LangChain szerint a webes kutatás az egyik fontos nyelvimodell-alkalmazás lehet. A vállalat ezért olyan rendszert kezdett fejleszteni, amely egy megadott kérdés alapján önállóan kutat az interneten. Az elképzeléshez olyan eszközökre volt szükség, amelyek keresnek és oldalakat adnak vissza, letöltik ezek teljes tartalmát, majd kinyerik a releváns információkat.
Ez a működés azt utánozta volna, ahogyan egy ember kutat: rákeres egy témára, kiválaszt néhány linket, átfutja az oldalakat, majd az új információk alapján folytatja a keresést. A LangChain beszámolója szerint az ügynök az iteratív keresési folyamatban fokozatosan elvesztette a fonalat. A csapat ezért egy másik architektúra felé indult el.
Párhuzamos keresésekből áll össze a válasz
A fejlesztők felismerték, hogy a mesterséges intelligencia egyik előnye a párhuzamos feldolgozás. A rendszer egyszerre több keresést indít, és több weboldal tartalmát is párhuzamosan olvassa be. Ez kevésbé hatékony lehet akkor, ha az elsőként megtalált cikk önmagában tartalmazza a szükséges információt, összetett kérdéseknél azonban a LangChain szerint indokolt lehet ez a megközelítés.
A retriever működése több lépésből áll. Egy nyelvi modell több releváns keresőkérdést generál, majd a rendszer mindegyik lekérdezéshez keresést futtat. A lekérdezésekhez tartozó legjobb találatokat párhuzamosan tölti be, a dokumentumokat vektortárba indexeli, végül minden eredeti keresőkérdéshez megkeresi a legfontosabb dokumentumrészleteket.
A kiválasztott szövegrészek bekerülnek a nyelvi modell kontextusába, amely ezek alapján készíti el a szintézist. A LangChain ezt a folyamatot a visszakereséssel támogatott generálás, vagyis a retrieval augmented generation logikájához kapcsolja. A megoldás hasonló az autonóm kutatóügynökök felépítéséhez, de a bemutatott rendszer maga nem ügynök.
Nyílt, helyi és megfigyelhető működés
A LangChain új retrievert és használati dokumentációt készített. A rendszert egy egyszerű Streamlit-felülettel is kiegészítették, amely körülbelül 50 sor kóddal készült. A felület tetszőleges nyelvi modellel, vektortárral és keresőeszközzel konfigurálható.
A vállalat szerint a megoldás privát módban is futtatható. A bejegyzés példaként a LlamaV2 modellt és a GPT4all beágyazásait említi. Ez lehetővé teszi, hogy a webes kutatási folyamat helyben, egy laptopon fusson, külső adatmegosztás nélkül. A LangChain a LangSmith segítségével azt is bemutatta, hogyan ellenőrizhető a retriever működése és a feldolgozási folyamat.
A csapat ezt csak első lépésnek tekinti. A jövőben olyan ügynöki képességeket adna hozzá, mint annak felmérése, hogy szükség van-e további információra, illetve több író- és felülvizsgálati ügynök használata a végső válasz elkészítéséhez.
Mit jelent ez a felhasználóknak?
A LangChain megközelítése azoknak lehet hasznos, akik webes kutatáshoz nem kizárólag hosztolt AI-keresőt szeretnének használni. A vállalat a helyi futtatást, a választható nyílt forráskódú összetevőket és a működés belső folyamatainak megfigyelhetőségét emeli ki. A rendszer így a fejlesztők számára beállíthatóbb és átláthatóbb lehet.
A projekt nyílt fejlesztési irányt is követ. A LangChain arra kéri az érdeklődőket, hogy ha további ügynöki képességeket adnának a retrieverhez, küldjenek módosításokat az alapul szolgáló repozitóriumhoz.
LangChain: Automating Web Research


