Az EncQA megmutatja, hol hibáznak a látó nyelvi modellek a diagramoknál

Az Apple kutatói új benchmarkot mutattak be a látó nyelvi modellek diagramértelmezési képességeinek vizsgálatára. Az EncQA 2076 szintetikus kérdés-válasz párral méri, hogy a modellek nyolc elemzési feladatban és hat vizuális kódolási csatornán hogyan teljesítenek.
- Az EncQA 2076 szintetikus kérdés-válasz párt tartalmaz.
- A benchmark hat vizuális kódolási csatornát és nyolc elemzési feladatot vizsgál.
- Kilenc korszerű látó nyelvi modellt értékeltek vele.
- Sok feladat és kódolás párosításánál a nagyobb modell nem teljesített jobban.
- A kutatók célzott fejlesztési stratégiákat javasolnak a diagramértelmezéshez.
A diagramok értelmezését részletesebben mérnék
Az EncQA célja, hogy a korábbi diagramértelmezési teszteknél rendszerezettebben fedje le a vizuális következtetés fontos területeit. Az Apple kutatói szerint a látó nyelvi modellek, vagyis a képi és szöveges információkat egyaránt feldolgozó rendszerek, folyamatosan jobb eredményeket érnek el a diagramok megértését vizsgáló benchmarkokon.
A kutatás következtetése szerint ezek a pontszámok önmagukban nem mutatják meg teljesen, milyen vizuális következtetési képességekre van szükség a diagramok értelmezéséhez. Az EncQA-t a vizualizációs szakirodalom alapján tervezték meg, hogy kiegyensúlyozottabb képet adjon a modellek teljesítményéről.
Hat vizuális csatorna és nyolc feladattípus
A benchmark 2076 szintetikus kérdés-válasz párból áll. Ezek hat vizuális kódolási csatornát fednek le: a pozíciót, a hosszúságot, a területet, a mennyiségi színt, a névleges színt és a formát.
A teszt nyolc feladattípust vizsgál. Ezek közé tartozik a szélsőértékek megtalálása, az értékek kiolvasása, a kiugró értékek felismerése, az értékek szűrése, valamint a levezetett értékek pontos és relatív kiszámítása. A benchmark emellett a korrelációk felismerését is méri, abszolút és relatív formában.
Az Apple oldalán közzétett tanulmány szerzői Kushin Mukherjee, Donghao Ren, Dominik Moritz és Yannick Assogba. Mukherjee Stanford Egyetemhez kötődik, a kutatási munkát pedig az Apple-nél végezte. A tanulmányt az IEEE Visualization konferencián mutatták be, a publikáció 2025 októberében jelent meg.
A nagyobb modell önmagában nem oldja meg a problémát
A kutatók kilenc korszerű látó nyelvi modellt értékeltek. Az eredmények jelentős eltéréseket mutattak ugyanazon feladaton belül az egyes vizuális kódolások között, és a különböző feladattípusok teljesítménye is számottevően változott.
A tanulmány egyik megállapítása szerint sok feladat és vizuális kódolás párosításánál a teljesítmény nem javult a modell méretének növelésével. Az eredmények alapján a diagramértelmezés fejlesztéséhez célzott stratégiákra lehet szükség, amelyek az egyes vizuális következtetési hiányosságokat kezelik. A kutatás így a modell vagy az adathalmaz puszta méretnövelése helyett a konkrét képességek külön vizsgálatát helyezi előtérbe.
Az EncQA a felhasználók számára azt jelentheti, hogy a diagramok értelmezésére képes modelleket részletesebb szempontok szerint lehet összehasonlítani. A benchmark külön választja például az értékek kiolvasását, a számításokat és a kapcsolatok felismerését, így pontosabban megmutathatja, mely feladatokban vannak eltérések a modellek között.


