Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenRouter élő tesztjei megmutatják, melyik webes keresés éri meg

2026. augusztus 12.Forrás: OpenRouter
Az OpenRouter élő tesztjei megmutatják, melyik webes keresés éri meg
Kép: OpenRouter

Az OpenRouter új, folyamatosan frissülő benchmarkoldalakon vizsgálja, hogyan teljesítenek a különböző modellek, keresőmotorok és keresési beállítások élő webes feladatokban. A vállalat szerint a keresési költségkeret növelése gyakran nagyobb minőségi javulást hoz, mint a keresőmotor cseréje.

A lényeg röviden
  • Az OpenRouter négy benchmarkon méri a webes keresési konfigurációkat.
  • A 25 keresési kör gyakran jelentősen javítja a pontszámot, de növeli a költséget.
  • A hibás válaszok átlagosan több keresési kört és nagyobb kiadást okoznak.
  • A modellváltás átlagosan nagyobb különbséget eredményezett, mint a keresőmotor cseréje.
  • A benchmarkok eredményei saját feladathalmazon is ellenőrizhetők az OpenRouteren.

Négy tényezőt és négy benchmarkot vizsgálnak

Az OpenRouter augusztus 12-én közzétett bejegyzése szerint egy webes keresési kérés beállításakor négy fő döntést kell meghozni: milyen modellt használunk, melyik keresőmotort választjuk, milyen keresési módszert alkalmazunk, és mekkora keresési költségkeretet engedélyezünk.

A platformon az Exa, a Parallel és a Perplexity keresőmotorjai mellett olyan fejlesztők natív keresői is elérhetők, mint az OpenAI, az Anthropic és a Google megoldásai. A keresés történhet a modell meghívása előtt, amikor az eredményeket kontextusként adják át, vagy egy olyan keresőeszközzel, amelyet maga a modell hív meg, amikor szükségesnek látja.

Az OpenRouter négy tesztsorozatot futtat: a BrowseComp nehéz ténykeresési feladatokat, a DeepSearchQA többlépcsős kutatási kérdéseket, a WideSearch széles körű, teljes táblázatok kitöltését igénylő feladatokat, a HLE pedig keresést használó szakértői vizsgakérdéseket vizsgálja. Az eredményoldalak a minőség, az érték és a sebesség szerint rangsorolják a konfigurációkat.

A több keresési kör látványosan javíthatja a pontszámot

Az OpenRouter BrowseComp mérésében, Perplexity használatával, a Claude Opus 5 magas gondolkodási szint mellett 1 keresési körben 35,8 százalékos, 5 körben 66,5 százalékos, 25 körben pedig 89,0 százalékos eredményt ért el. A hozzájuk tartozó költség kérdésenként 0,14, 0,51 és 0,99 dollár volt.

A GPT-5.6 Sol magas szinten 46,3, 65,2, illetve 82,4 százalékot ért el, 0,20, 0,29 és 0,50 dolláros költség mellett. A GPT-5.6 Luna extra magas szinten 33,7, 57,0 és 74,0 százalékot teljesített, 0,02, 0,04 és 0,10 dolláros költséggel.

A vállalat szerint az 1 körös keresésről 25 körre váltás nagyjából megduplázta a pontszámot, miközben a kérdésenkénti költség 2,5 és 7-szeresére nőtt. A több keresés azonban nem minden feladatnál indokolt. A HLE tesztben a GPT-5.6 Sol Perplexityvel hasonló eredményt ért el 1 és 25 kör között, miközben a 25 körös beállítás háromszor annyiba került.

A sikertelen válaszok különösen drágák lehetnek. A 25 körös keretben a hibás válaszokhoz átlagosan 19,7 keresés tartozott a BrowseComp, 20,1 a DeepSearchQA, 7,5 a HLE és 23,4 a WideSearch esetében. Az OpenRouter egy WideSearch táblázatnál 81 keresést rögzített, a válasz mégis hibás lett.

A modellválasztás fontosabb lehet a keresőmotornál

Az OpenRouter 25 keresési kör mellett is összevetette a modelleket és a motorokat a BrowseCompban. A Claude Opus 5 magas szinten Perplexityvel 89,0, Exával 82,2, Parallelel 88,8 százalékot ért el. A GPT-5.6 Sol eredménye ugyanezekkel a motorokkal 82,4, 77,8 és 76,6 százalék volt.

A DeepSeek V4 Flash magas szinten 77,0, 67,4 és 64,6 százalékot, a GPT-5.6 Luna extra magas szinten pedig 74,0, 68,4 és 58,0 százalékot ért el. A költség rendre 0,08, 0,12 és 0,10 dollár volt a DeepSeek esetében, illetve 0,10, 0,14 és 0,11 dollár a Luna esetében.

A forrás szerint a keresőmotor cseréje ugyanazon modell mellett átlagosan 10 százalékpontos eltérést okozott, míg a fejlettebb és a költséghatékony modellek közötti átlagos különbség 15 pont volt. Az OpenRouter ezért azt javasolja, hogy a felhasználók a saját feladataikhoz legközelebb álló benchmarkot válasszák, majd a legjobb eredmény néhány legolcsóbb konfigurációját saját kérdéseiken is teszteljék.

A beállítások közvetlenül elérhetők az OpenRouteren

A webes bővítmény egyetlen keresést futtat a válasz megírása előtt, ezért az OpenRouter ezt gyors és olcsó opciónak írja le friss tényeket igénylő kérdésekhez. A szerveres eszköz ezzel szemben a modellre bízza, hogy mit és mikor keres meg, így több lépésből álló válaszoknál használható.

A kérésekben az Exa, a Parallel, a Perplexity vagy a native érték adható meg motorként. Az auto beállítás először natív motort próbál, majd szükség esetén külső szolgáltatóra vált. A max_tool_calls mező korlátozza a keresési körök számát, a max_results pedig az egyes körökben visszaadott találatok mennyiségét.

A benchmarkok nyilvános OpenRouter API-n, éles végpontokon futnak, nyílt forráskódú mérési keretrendszerrel. A teszteket tíz találattal keresésenként, oldalbetöltés és kódvégrehajtás nélkül végzik. Az eredmények élők, ezért az új futások és modellek megjelenésével a rangsorok és a pontszámok változhatnak.

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2.

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát
Fejlesztőknek2026. október 1.

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát

Az Arize AI az Alyx AI-mérnöki ügynök hosszú távú memóriáját egyetlen, strukturált szövegfájlra építette fel felhasználónként és Arize space-enként. A vállalat szerint…

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját
Fejlesztőknek2026. október 1.

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját

Az Arize AI egy strukturált szövegfájlra egyszerűsítette Alyx, az Arize AX mesterségesintelligencia-mérnöki ügynökének hosszú távú memóriáját. A cég szerint a megoldás…