Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

OpenResearcher: offline adatokkal tanítanák a deep research ügynököket

2026. szeptember 10.Forrás: Lambda
OpenResearcher: offline adatokkal tanítanák a deep research ügynököket
Kép: Lambda

Az OpenResearcher kutatási rendszer több mint 97 ezer szintetikus kutatási folyamatból tanított egy kisebb modellt, teljesen offline környezetben. A fejlesztők szerint az így szerzett keresési és bizonyítékgyűjtési képességek az élő weben is működnek.

A lényeg röviden
  • Az OpenResearcher offline kutatási környezetet épít több mint 15 millió dokumentumból.
  • A GPT-OSS-120B több mint 97 ezer hosszú kutatási útvonalat generált.
  • Az OpenResearcher-30B-A3B 54,8 százalékot ért el a BrowseComp-Plus teszten.
  • A tanításhoz nem használtak élő webes kutatási útvonalakat.
  • Az NVIDIA két projektje is átvette az OpenResearcher megközelítését.

A kutatási folyamatot is meg kell tanítani

Egy deep research ügynök feladata túlmutat egy kérdés megválaszolásán. Meg kell terveznie a kutatást, keresnie kell, dokumentumokat kell megnyitnia, bizonyítékokat kell összegyűjtenie, majd több forrás alapján kell következtetnie. A folyamat akár több tucat vagy több száz eszközhíváson keresztül is folytatódhat.

A Lambda szerint a hagyományos kérdés-válasz párok ezt a működést nem tudják megfelelően rögzíteni. Az emberi kutatási adatok gyűjtése drága és nehezen skálázható, a szintetikus adatok előállítása pedig nagy mennyiségű keresési és lekérési műveletet igényel. Élő webes környezetben ehhez API-költségek, sebességkorlátok és futásonként változó keresési eredmények is társulnak.

15 millió dokumentum és 97 ezer kutatási útvonal

A Texas A&M University, a University of Waterloo, az UC San Diego és a Lambda kutatói ezért létrehozták az OpenResearchert. A munkát az EMNLP 2026 konferencia fő programjának tanulmányaként fogadták el.

A rendszer egy reprodukálható, offline kutatási környezetet épít több mint 15 millió dokumentumból. A folyamat 6000 hosszú kutatási kérdéssel indul, amelyekből nagyjából 10 ezer hiteles dokumentumot állítanak elő, majd ezeket 15 millió FineWeb-dokumentummal egészítik ki. A dokumentumokat Qwen3-Embedding-8B segítségével ágyazzák be 8 darab, egyenként 80 GB-os NVIDIA A100 Tensor Core GPU-n, körülbelül nyolc óra alatt. A FAISS-indexet 4 darab, egyenként 80 GB-os NVIDIA H100 GPU szolgálja ki.

Az ügynök három eszközt használ: keresést, dokumentummegnyitást és a bizonyítékok megtalálását. A környezet offline működik, így az eredmények a különböző futtatások között változatlanok maradnak.

A GPT-OSS-120B tanármodellként dolgozik, és önállóan keres, dokumentumokat nyit meg, bizonyítékokat gyűjt, majd újra és újra finomítja a választ. A 64 H100 GPU-n, körülbelül két napig futó elosztott következtetés több mint 97 ezer hosszú kutatási útvonalat eredményezett. A hibás, hiányos és gyenge minőségű útvonalakat kiszűrték.

A kisebb modell az élő weben is teljesített

A megtisztított szintetikus útvonalakkal a kutatók a Nemotron-3-Nano-30B-A3B modellt finomhangolták. A tanítás során legfeljebb 256 ezer tokenes kontextusokat használtak, hogy a teljes kutatási interakciók megmaradjanak. A hosszú kontextusú finomhangolás 8 H100 GPU-n körülbelül nyolc órát vett igénybe.

Az OpenResearcher-30B-A3B a BrowseComp-Plus teszten 54,8 százalékot ért el. Ez a Lambda közlése szerint meghaladta a GPT-4.1 36,4 százalékos, a Claude-4-Opus 36,8 százalékos és a DeepSeek-R1 16,4 százalékos eredményét. Az alap Nemotron-3-Nano-30B-A3B 20,8 százalékot teljesített.

A rendszer a BrowseComp teszten 26,3 százalékot, a GAIA benchmarkon 64,1 százalékot, az xbench-DeepSearch teszten pedig 65,0 százalékot ért el. A forrás szerint a tanítás során nem használtak élő webes kutatási útvonalakat, a keresés, a bizonyítékgyűjtés, az eszközhasználat és a hosszú következtetési folyamat mégis átkerült az élő webes feladatokra.

A szintetikus tapasztalat önálló számítási feladattá válhat

Az OpenResearcher fejlesztői szerint a módszer a számítási kapacitás felhasználásának átrendeződését mutatja. A nagy modell következtetésekkel szintetikus tapasztalatot állít elő, ezt egy kisebb modell utólagos tanítására használják, majd az így kapott ügynök erősebb kutatási képességeket szerez. A tanármodell futtatása 64 H100 GPU-n körülbelül két napig tartott, míg a tanulómodell utólagos tanítása 8 H100 GPU-n körülbelül nyolc órát vett igénybe.

A megközelítés már a projekten túl is megjelent. Az NVIDIA az OpenResearcher útvonalait SFT-adatként használta a Nemotron 3 Ultra modellhez, az NVIDIA NeMo Data Designer pedig a deep research útvonalak előállításánál épít erre a módszerre. A fejlesztők szerint így a nagy modellű következtetés, a szintetikusadat-generálás és a hosszú kontextusú utólagos tanítás egyaránt olyan munkafolyamattá válik, amely nagy léptékű GPU-kapacitást igényel.

Kapcsolódó hírek

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4.

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt…

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké
Fejlesztőknek2026. szeptember 30.

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a…