OpenResearcher: offline adatokkal tanítanák a deep research ügynököket

Az OpenResearcher kutatási rendszer több mint 97 ezer szintetikus kutatási folyamatból tanított egy kisebb modellt, teljesen offline környezetben. A fejlesztők szerint az így szerzett keresési és bizonyítékgyűjtési képességek az élő weben is működnek.
- Az OpenResearcher offline kutatási környezetet épít több mint 15 millió dokumentumból.
- A GPT-OSS-120B több mint 97 ezer hosszú kutatási útvonalat generált.
- Az OpenResearcher-30B-A3B 54,8 százalékot ért el a BrowseComp-Plus teszten.
- A tanításhoz nem használtak élő webes kutatási útvonalakat.
- Az NVIDIA két projektje is átvette az OpenResearcher megközelítését.
A kutatási folyamatot is meg kell tanítani
Egy deep research ügynök feladata túlmutat egy kérdés megválaszolásán. Meg kell terveznie a kutatást, keresnie kell, dokumentumokat kell megnyitnia, bizonyítékokat kell összegyűjtenie, majd több forrás alapján kell következtetnie. A folyamat akár több tucat vagy több száz eszközhíváson keresztül is folytatódhat.
A Lambda szerint a hagyományos kérdés-válasz párok ezt a működést nem tudják megfelelően rögzíteni. Az emberi kutatási adatok gyűjtése drága és nehezen skálázható, a szintetikus adatok előállítása pedig nagy mennyiségű keresési és lekérési műveletet igényel. Élő webes környezetben ehhez API-költségek, sebességkorlátok és futásonként változó keresési eredmények is társulnak.
15 millió dokumentum és 97 ezer kutatási útvonal
A Texas A&M University, a University of Waterloo, az UC San Diego és a Lambda kutatói ezért létrehozták az OpenResearchert. A munkát az EMNLP 2026 konferencia fő programjának tanulmányaként fogadták el.
A rendszer egy reprodukálható, offline kutatási környezetet épít több mint 15 millió dokumentumból. A folyamat 6000 hosszú kutatási kérdéssel indul, amelyekből nagyjából 10 ezer hiteles dokumentumot állítanak elő, majd ezeket 15 millió FineWeb-dokumentummal egészítik ki. A dokumentumokat Qwen3-Embedding-8B segítségével ágyazzák be 8 darab, egyenként 80 GB-os NVIDIA A100 Tensor Core GPU-n, körülbelül nyolc óra alatt. A FAISS-indexet 4 darab, egyenként 80 GB-os NVIDIA H100 GPU szolgálja ki.
Az ügynök három eszközt használ: keresést, dokumentummegnyitást és a bizonyítékok megtalálását. A környezet offline működik, így az eredmények a különböző futtatások között változatlanok maradnak.
A GPT-OSS-120B tanármodellként dolgozik, és önállóan keres, dokumentumokat nyit meg, bizonyítékokat gyűjt, majd újra és újra finomítja a választ. A 64 H100 GPU-n, körülbelül két napig futó elosztott következtetés több mint 97 ezer hosszú kutatási útvonalat eredményezett. A hibás, hiányos és gyenge minőségű útvonalakat kiszűrték.
A kisebb modell az élő weben is teljesített
A megtisztított szintetikus útvonalakkal a kutatók a Nemotron-3-Nano-30B-A3B modellt finomhangolták. A tanítás során legfeljebb 256 ezer tokenes kontextusokat használtak, hogy a teljes kutatási interakciók megmaradjanak. A hosszú kontextusú finomhangolás 8 H100 GPU-n körülbelül nyolc órát vett igénybe.
Az OpenResearcher-30B-A3B a BrowseComp-Plus teszten 54,8 százalékot ért el. Ez a Lambda közlése szerint meghaladta a GPT-4.1 36,4 százalékos, a Claude-4-Opus 36,8 százalékos és a DeepSeek-R1 16,4 százalékos eredményét. Az alap Nemotron-3-Nano-30B-A3B 20,8 százalékot teljesített.
A rendszer a BrowseComp teszten 26,3 százalékot, a GAIA benchmarkon 64,1 százalékot, az xbench-DeepSearch teszten pedig 65,0 százalékot ért el. A forrás szerint a tanítás során nem használtak élő webes kutatási útvonalakat, a keresés, a bizonyítékgyűjtés, az eszközhasználat és a hosszú következtetési folyamat mégis átkerült az élő webes feladatokra.
A szintetikus tapasztalat önálló számítási feladattá válhat
Az OpenResearcher fejlesztői szerint a módszer a számítási kapacitás felhasználásának átrendeződését mutatja. A nagy modell következtetésekkel szintetikus tapasztalatot állít elő, ezt egy kisebb modell utólagos tanítására használják, majd az így kapott ügynök erősebb kutatási képességeket szerez. A tanármodell futtatása 64 H100 GPU-n körülbelül két napig tartott, míg a tanulómodell utólagos tanítása 8 H100 GPU-n körülbelül nyolc órát vett igénybe.
A megközelítés már a projekten túl is megjelent. Az NVIDIA az OpenResearcher útvonalait SFT-adatként használta a Nemotron 3 Ultra modellhez, az NVIDIA NeMo Data Designer pedig a deep research útvonalak előállításánál épít erre a módszerre. A fejlesztők szerint így a nagy modellű következtetés, a szintetikusadat-generálás és a hosszú kontextusú utólagos tanítás egyaránt olyan munkafolyamattá válik, amely nagy léptékű GPU-kapacitást igényel.


