Az OpenRouter új eszközzel segít kiválasztani a megfelelő AI-modellt

Az OpenRouter bemutatta az Ori Evalt, amely a fejlesztők saját alkalmazásán futtat értékeléseket, és ezek alapján segít kiválasztani a megfelelő AI-modellt. Az eszköz a válaszok minőségét, az eszközhasználatot, a költséget és más, a fejlesztő által fontosnak tartott szempontokat is vizsgálhatja.
- Az Ori Eval a fejlesztő saját kódján és promptjain hasonlítja össze az AI-modelleket.
- A rendszer öt, az elvárásoknak megfelelő legújabb modellt választ ki tesztelésre.
- Az értékelések az eszközhasználatot, a válaszminőséget és a regressziókat is vizsgálhatják.
- A tesztek GitHub Actions munkafolyamatba illeszthetők, és új modellek megjelenésekor újrafuttathatók.
A saját alkalmazás teljesítménye alapján választ
Az OpenRouter szerint az AI-modellek kiválasztása egyre nehezebb, mivel több mint 500 modell közül lehet választani, miközben hetente jelennek meg új rendszerek. A döntést sok csapat közösségi médiában látott ajánlásokra, ranglistákra vagy általános benyomásokra alapozza.
A vállalat szerint ezek az információk hasznosak, de nem mutatják meg, hogyan teljesít egy modell egy konkrét alkalmazásban, adott tesztkörnyezetben, saját adatokon és promptokkal. Az Ori Eval ezt a hiányt próbálja kezelni. A szolgáltatás fejlesztői kódon és saját használati eseteken hasonlítja össze a modelleket, így az OpenRouter megfogalmazása szerint nincs minden feladatra egyetlen legjobb modell, csak az adott projekthez legjobban illő modell.
Az Ori Eval elkészíti és lefuttatja a teszteket
Az eszköz használatához a fejlesztőnek egy kódolóügynökben kell elindítania a curl -fsSL https://openrouter.ai/skills/spawn-ori-eval parancsot, majd követnie kell a megjelenő utasításokat. Az Ori Eval átvizsgálja a kódbázist, megkeresi, hol futtat a program modellt, és megmutatja a használati esetet, a pontos fájlt, valamint a jelenleg használt modellt.
Ezután kérdéseket tesz fel arról, hogy a fejlesztő hol szeretné használni az értékelést, illetve mi számít a legtöbbet: például a pontosság, a sebesség vagy a költség. A válaszok alapján kiválasztja az elvárásoknak megfelelő öt legújabb modellt, majd megerősítést kér. Ezt követően létrehoz egy review.eval.ts fájlt, párhuzamosan lefuttatja az ügynököt a jelölteken, és táblázatban közli az eredményeket.
Az OpenRouter példája olyan adatokat sorol fel, mint a hibafelismerési arány, a p50 késleltetés, a kérésenkénti költség és a teszt eredménye. A javaslat az adott költségkorláton belüli legjobb hibafelismerési arányra és egy értékarányos választásra is kitérhet.
Eszközhasználatot, válaszminőséget és regressziókat is vizsgál
Az Ori Eval által létrehozott értékelési fájl kód, amely a bun test paranccsal futtatható. A teszt ellenőrizheti, hogy az ügynök meghívta-e a szükséges eszközt, elkerülte-e a tiltott eszközöket, valamint hogy elkészült-e a válasza. A nyitott végű válaszokat nagy nyelvi modell alapú bíró értékeli. A fejlesztő megadhatja az értékelési szempontokat és a minimális pontszámot.
A rendszer hibajelentésekből is tesztet készíthet. Ha például egy ügyfélszolgálati ügynök a rendelés ellenőrzése nélkül indít visszatérítést, az Ori Eval olyan ellenőrzést írhat, amely megköveteli a rendelés lekérdezését. A javítás után a teszt átmegy, az ellenőrzés pedig a tesztcsomagban marad.
Az OpenRouter szerint az Ori Eval futás közben rögzíti a tesztkörnyezetet, a modellt és az erőfeszítési szintet. Így ugyanabban a környezetben az eredmény változása a modell változásához köthető. A fejlesztők az értékeléseket GitHub Actions munkafolyamatba is beilleszthetik. A sikertelen teszt meghiúsítja a buildet, így a regresszió nem jut el az éles rendszerbe.
A fejlesztők rendszeresen újramérhetik a modelleket
Az OpenRouter szerint az Ori Eval tesztjei időzítve is futtathatók. A vállalat egyik korai bétatesztelője havonta hasonlítja össze a modelleket. Ha egy új modell jobban teljesít a meglévőnél az adott kódbázisban, a rendszer pull requestet nyithat, amelyet a fejlesztőnek csak át kell néznie és össze kell olvasztania.
Az Ori telepítése a megadott parancson keresztül történik, majd a felhasználónak be kell jelentkeznie. OpenRouter MCP-szerver használatakor a /spawn-ori-eval parancs is alkalmazható. Kézi telepítéshez az OpenRouter külön telepítőparancsot ad, az értékelések futtatásához pedig Bun szükséges. A megközelítés a fejlesztők számára azt jelentheti, hogy a modellválasztást saját alkalmazásuk mérhető eredményeire, a hibákra és a költségigényre alapozhatják.
OpenRouter: Ori Eval: Find the Best Model for What You're Building


