Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenRouter új eszközzel segít kiválasztani a megfelelő AI-modellt

2026. augusztus 3.Forrás: OpenRouter
Az OpenRouter új eszközzel segít kiválasztani a megfelelő AI-modellt
Kép: OpenRouter

Az OpenRouter bemutatta az Ori Evalt, amely a fejlesztők saját alkalmazásán futtat értékeléseket, és ezek alapján segít kiválasztani a megfelelő AI-modellt. Az eszköz a válaszok minőségét, az eszközhasználatot, a költséget és más, a fejlesztő által fontosnak tartott szempontokat is vizsgálhatja.

A lényeg röviden
  • Az Ori Eval a fejlesztő saját kódján és promptjain hasonlítja össze az AI-modelleket.
  • A rendszer öt, az elvárásoknak megfelelő legújabb modellt választ ki tesztelésre.
  • Az értékelések az eszközhasználatot, a válaszminőséget és a regressziókat is vizsgálhatják.
  • A tesztek GitHub Actions munkafolyamatba illeszthetők, és új modellek megjelenésekor újrafuttathatók.

A saját alkalmazás teljesítménye alapján választ

Az OpenRouter szerint az AI-modellek kiválasztása egyre nehezebb, mivel több mint 500 modell közül lehet választani, miközben hetente jelennek meg új rendszerek. A döntést sok csapat közösségi médiában látott ajánlásokra, ranglistákra vagy általános benyomásokra alapozza.

A vállalat szerint ezek az információk hasznosak, de nem mutatják meg, hogyan teljesít egy modell egy konkrét alkalmazásban, adott tesztkörnyezetben, saját adatokon és promptokkal. Az Ori Eval ezt a hiányt próbálja kezelni. A szolgáltatás fejlesztői kódon és saját használati eseteken hasonlítja össze a modelleket, így az OpenRouter megfogalmazása szerint nincs minden feladatra egyetlen legjobb modell, csak az adott projekthez legjobban illő modell.

Az Ori Eval elkészíti és lefuttatja a teszteket

Az eszköz használatához a fejlesztőnek egy kódolóügynökben kell elindítania a curl -fsSL https://openrouter.ai/skills/spawn-ori-eval parancsot, majd követnie kell a megjelenő utasításokat. Az Ori Eval átvizsgálja a kódbázist, megkeresi, hol futtat a program modellt, és megmutatja a használati esetet, a pontos fájlt, valamint a jelenleg használt modellt.

Ezután kérdéseket tesz fel arról, hogy a fejlesztő hol szeretné használni az értékelést, illetve mi számít a legtöbbet: például a pontosság, a sebesség vagy a költség. A válaszok alapján kiválasztja az elvárásoknak megfelelő öt legújabb modellt, majd megerősítést kér. Ezt követően létrehoz egy review.eval.ts fájlt, párhuzamosan lefuttatja az ügynököt a jelölteken, és táblázatban közli az eredményeket.

Az OpenRouter példája olyan adatokat sorol fel, mint a hibafelismerési arány, a p50 késleltetés, a kérésenkénti költség és a teszt eredménye. A javaslat az adott költségkorláton belüli legjobb hibafelismerési arányra és egy értékarányos választásra is kitérhet.

Eszközhasználatot, válaszminőséget és regressziókat is vizsgál

Az Ori Eval által létrehozott értékelési fájl kód, amely a bun test paranccsal futtatható. A teszt ellenőrizheti, hogy az ügynök meghívta-e a szükséges eszközt, elkerülte-e a tiltott eszközöket, valamint hogy elkészült-e a válasza. A nyitott végű válaszokat nagy nyelvi modell alapú bíró értékeli. A fejlesztő megadhatja az értékelési szempontokat és a minimális pontszámot.

A rendszer hibajelentésekből is tesztet készíthet. Ha például egy ügyfélszolgálati ügynök a rendelés ellenőrzése nélkül indít visszatérítést, az Ori Eval olyan ellenőrzést írhat, amely megköveteli a rendelés lekérdezését. A javítás után a teszt átmegy, az ellenőrzés pedig a tesztcsomagban marad.

Az OpenRouter szerint az Ori Eval futás közben rögzíti a tesztkörnyezetet, a modellt és az erőfeszítési szintet. Így ugyanabban a környezetben az eredmény változása a modell változásához köthető. A fejlesztők az értékeléseket GitHub Actions munkafolyamatba is beilleszthetik. A sikertelen teszt meghiúsítja a buildet, így a regresszió nem jut el az éles rendszerbe.

A fejlesztők rendszeresen újramérhetik a modelleket

Az OpenRouter szerint az Ori Eval tesztjei időzítve is futtathatók. A vállalat egyik korai bétatesztelője havonta hasonlítja össze a modelleket. Ha egy új modell jobban teljesít a meglévőnél az adott kódbázisban, a rendszer pull requestet nyithat, amelyet a fejlesztőnek csak át kell néznie és össze kell olvasztania.

Az Ori telepítése a megadott parancson keresztül történik, majd a felhasználónak be kell jelentkeznie. OpenRouter MCP-szerver használatakor a /spawn-ori-eval parancs is alkalmazható. Kézi telepítéshez az OpenRouter külön telepítőparancsot ad, az értékelések futtatásához pedig Bun szükséges. A megközelítés a fejlesztők számára azt jelentheti, hogy a modellválasztást saját alkalmazásuk mérhető eredményeire, a hibákra és a költségigényre alapozhatják.

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2.

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Az OpenRouter új oldalon hasonlítja össze a modellroutereket
Fejlesztőknek2026. október 2.

Az OpenRouter új oldalon hasonlítja össze a modellroutereket

Az OpenRouter új Model Router Benchmarks oldalt indított, amely különböző területeken méri össze a modellrouterek teljesítményét. A rendszer a válaszminőséget, a…

Az OpenRouter összehasonlító oldalt indított a modellirányítókról
Fejlesztőknek2026. október 2.

Az OpenRouter összehasonlító oldalt indított a modellirányítókról

Az OpenRouter új Model Router Benchmarks oldalon hasonlítja össze a különböző modellirányítók teljesítményét. A tesztek a válaszminőséget, a sebességet és a költséget…