Az OpenRouter vizuális tesztekkel hasonlítja össze a képgeneráló modelleket

Az OpenRouter vizuális kép-benchmarkot indított, amellyel a platformon elérhető képgeneráló modellek képességei hasonlíthatók össze. A tesztek 39 modellt vizsgáltak 2026 augusztusában, az eredmények pedig ár és generálási idő szerint is rendezhetők.
- Az OpenRouter vizuális benchmarkot indított a képgeneráló modellek összehasonlítására.
- A teszt 2026 augusztusában 39, a platformon kínált modellt vizsgált.
- A feladatok hét kategóriába tartoznak, köztük a számlálás, a szövegkezelés és a képszerkesztés.
- Az eredmények ár és generálási idő szerint rendezhető rácsban jelennek meg.
- Az OpenRouter a benchmarkokat további modellekre és modalitásokra is kiterjesztené.
A képgeneráló modellek összehasonlítását segíti az új teszt
Az OpenRouter szerint egy képgeneráló modell kiválasztása nehezebb lehet, mint egy szöveges modellé. A nyelvi modellekhez sok benchmark áll rendelkezésre, míg a képgenerátorok bemutatói gyakran gondosan válogatott, látványos mintákból állnak. Az OpenRouter úgy látja, hogy a nyelvi modellel végzett értékelések sem képesek még minden olyan részletet megragadni, amelyet az ember azonnal észrevesz.
Az arénapontszámok segíthetnek a választásban, ezek azonban elsősorban azt mérik, hogy az emberek melyik eredményt részesítik előnyben. Az új Visual Image Benchmarks célja ezzel szemben az, hogy gyorsan áttekinthetővé tegye, mire képesek ténylegesen az OpenRouter által kínált képgeneráló modellek.
A bejelentés 2026. augusztus 21-én jelent meg, majd szeptember 3-án frissítették. Az OpenRouter közlése szerint 2026 augusztusában 39 képgeneráló modell volt elérhető a platformon.
Hét kategóriában keresik a modellek gyenge pontjait
A benchmark kihívást jelentő utasításokat használ, amelyek célja a modellek képességeinek megkülönböztetése. A teszteket kezdetben hét csoportba sorolták.
- Valószínűtlen jelenetek: például egy pereméig töltött borospohár vagy becsukott esernyők.
- Számlálás: többek között három ujj, illetve meghatározott számú kártya és dobókocka megjelenítése.
- Szöveg: egy hosszú, pontos karakterlánc elhelyezése egy plakáton, valamint több nyelv használata ugyanabban a képkockában.
- Térbeli viszonyok: takarás és tükörképek kezelése.
- Tagadás: például csíkok nélküli zebra vagy reklámok nélküli Times Square létrehozása.
- Szerkesztés: minimális módosítások, tárgyak és emberek eltávolítása referencia-képből.
- Következetesség: egy termék vagy négy referenciaalany megtartása egy új jelenetben.
Az OpenRouter szerint a feladatokat úgy fogalmazták meg, hogy az eredmények vizuálisan azonnal értékelhetők legyenek. Példaként azt említi, hogy könnyen megállapítható, képes-e egy modell teljesen megtölteni egy borospoharat.
Az eredmények rácsban, ár és sebesség szerint is láthatók
A benchmark minden eredményt egy rácsban jelenít meg. A felhasználók az eredményeket az ár és a generálási idő alapján is rendezhetik, így több szempont szerint tekinthetik át az elérhető modelleket. A megközelítés a mintaképek és a képességekre kihegyezett feladatok közvetlen összevetésére épül.
Az OpenRouter azt tervezi, hogy a rendszert naprakészen tartja az új képgeneráló modellek megjelenésekor. A vállalat szerint a videó- és hangmodellek minőségének, illetve képességeinek értékelése hasonlóan nehéz, ezért a vizuális értékeléseket további modalitásokra is kiterjesztenék.
A szolgáltatás felhasználói a benchmarkok után saját utasításaikkal is kipróbálhatják a modelleket az OpenRouter képgenerálási API-ján vagy a Chaten keresztül. A vállalat a következő modellkör teszteléséhez olyan feladatjavaslatokat vár, amelyek újabb képességeket tehetnek mérhetővé. Ezeket a Discord #feedback csatornáján lehet megosztani.
OpenRouter: Image Benchmarks: See the Capabilities of Every Model


