Az OpenRouter élő tesztjei megmutatják, melyik webes keresés éri meg

Az OpenRouter új, folyamatosan frissülő benchmarkoldalakon vizsgálja, hogyan teljesítenek a különböző modellek, keresőmotorok és keresési beállítások élő webes feladatokban. A vállalat szerint a keresési költségkeret növelése gyakran nagyobb minőségi javulást hoz, mint a keresőmotor cseréje.
- Az OpenRouter négy benchmarkon méri a webes keresési konfigurációkat.
- A 25 keresési kör gyakran jelentősen javítja a pontszámot, de növeli a költséget.
- A hibás válaszok átlagosan több keresési kört és nagyobb kiadást okoznak.
- A modellváltás átlagosan nagyobb különbséget eredményezett, mint a keresőmotor cseréje.
- A benchmarkok eredményei saját feladathalmazon is ellenőrizhetők az OpenRouteren.
Négy tényezőt és négy benchmarkot vizsgálnak
Az OpenRouter augusztus 12-én közzétett bejegyzése szerint egy webes keresési kérés beállításakor négy fő döntést kell meghozni: milyen modellt használunk, melyik keresőmotort választjuk, milyen keresési módszert alkalmazunk, és mekkora keresési költségkeretet engedélyezünk.
A platformon az Exa, a Parallel és a Perplexity keresőmotorjai mellett olyan fejlesztők natív keresői is elérhetők, mint az OpenAI, az Anthropic és a Google megoldásai. A keresés történhet a modell meghívása előtt, amikor az eredményeket kontextusként adják át, vagy egy olyan keresőeszközzel, amelyet maga a modell hív meg, amikor szükségesnek látja.
Az OpenRouter négy tesztsorozatot futtat: a BrowseComp nehéz ténykeresési feladatokat, a DeepSearchQA többlépcsős kutatási kérdéseket, a WideSearch széles körű, teljes táblázatok kitöltését igénylő feladatokat, a HLE pedig keresést használó szakértői vizsgakérdéseket vizsgálja. Az eredményoldalak a minőség, az érték és a sebesség szerint rangsorolják a konfigurációkat.
A több keresési kör látványosan javíthatja a pontszámot
Az OpenRouter BrowseComp mérésében, Perplexity használatával, a Claude Opus 5 magas gondolkodási szint mellett 1 keresési körben 35,8 százalékos, 5 körben 66,5 százalékos, 25 körben pedig 89,0 százalékos eredményt ért el. A hozzájuk tartozó költség kérdésenként 0,14, 0,51 és 0,99 dollár volt.
A GPT-5.6 Sol magas szinten 46,3, 65,2, illetve 82,4 százalékot ért el, 0,20, 0,29 és 0,50 dolláros költség mellett. A GPT-5.6 Luna extra magas szinten 33,7, 57,0 és 74,0 százalékot teljesített, 0,02, 0,04 és 0,10 dolláros költséggel.
A vállalat szerint az 1 körös keresésről 25 körre váltás nagyjából megduplázta a pontszámot, miközben a kérdésenkénti költség 2,5 és 7-szeresére nőtt. A több keresés azonban nem minden feladatnál indokolt. A HLE tesztben a GPT-5.6 Sol Perplexityvel hasonló eredményt ért el 1 és 25 kör között, miközben a 25 körös beállítás háromszor annyiba került.
A sikertelen válaszok különösen drágák lehetnek. A 25 körös keretben a hibás válaszokhoz átlagosan 19,7 keresés tartozott a BrowseComp, 20,1 a DeepSearchQA, 7,5 a HLE és 23,4 a WideSearch esetében. Az OpenRouter egy WideSearch táblázatnál 81 keresést rögzített, a válasz mégis hibás lett.
A modellválasztás fontosabb lehet a keresőmotornál
Az OpenRouter 25 keresési kör mellett is összevetette a modelleket és a motorokat a BrowseCompban. A Claude Opus 5 magas szinten Perplexityvel 89,0, Exával 82,2, Parallelel 88,8 százalékot ért el. A GPT-5.6 Sol eredménye ugyanezekkel a motorokkal 82,4, 77,8 és 76,6 százalék volt.
A DeepSeek V4 Flash magas szinten 77,0, 67,4 és 64,6 százalékot, a GPT-5.6 Luna extra magas szinten pedig 74,0, 68,4 és 58,0 százalékot ért el. A költség rendre 0,08, 0,12 és 0,10 dollár volt a DeepSeek esetében, illetve 0,10, 0,14 és 0,11 dollár a Luna esetében.
A forrás szerint a keresőmotor cseréje ugyanazon modell mellett átlagosan 10 százalékpontos eltérést okozott, míg a fejlettebb és a költséghatékony modellek közötti átlagos különbség 15 pont volt. Az OpenRouter ezért azt javasolja, hogy a felhasználók a saját feladataikhoz legközelebb álló benchmarkot válasszák, majd a legjobb eredmény néhány legolcsóbb konfigurációját saját kérdéseiken is teszteljék.
A beállítások közvetlenül elérhetők az OpenRouteren
A webes bővítmény egyetlen keresést futtat a válasz megírása előtt, ezért az OpenRouter ezt gyors és olcsó opciónak írja le friss tényeket igénylő kérdésekhez. A szerveres eszköz ezzel szemben a modellre bízza, hogy mit és mikor keres meg, így több lépésből álló válaszoknál használható.
A kérésekben az Exa, a Parallel, a Perplexity vagy a native érték adható meg motorként. Az auto beállítás először natív motort próbál, majd szükség esetén külső szolgáltatóra vált. A max_tool_calls mező korlátozza a keresési körök számát, a max_results pedig az egyes körökben visszaadott találatok mennyiségét.
A benchmarkok nyilvános OpenRouter API-n, éles végpontokon futnak, nyílt forráskódú mérési keretrendszerrel. A teszteket tíz találattal keresésenként, oldalbetöltés és kódvégrehajtás nélkül végzik. Az eredmények élők, ezért az új futások és modellek megjelenésével a rangsorok és a pontszámok változhatnak.


