Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az EncQA megmutatja, hol hibáznak a látó nyelvi modellek a diagramoknál

2026. szeptember 16.Forrás: Apple
Az EncQA megmutatja, hol hibáznak a látó nyelvi modellek a diagramoknál
Kép: Apple

Az Apple kutatói új benchmarkot mutattak be a látó nyelvi modellek diagramértelmezési képességeinek vizsgálatára. Az EncQA 2076 szintetikus kérdés-válasz párral méri, hogy a modellek nyolc elemzési feladatban és hat vizuális kódolási csatornán hogyan teljesítenek.

A lényeg röviden
  • Az EncQA 2076 szintetikus kérdés-válasz párt tartalmaz.
  • A benchmark hat vizuális kódolási csatornát és nyolc elemzési feladatot vizsgál.
  • Kilenc korszerű látó nyelvi modellt értékeltek vele.
  • Sok feladat és kódolás párosításánál a nagyobb modell nem teljesített jobban.
  • A kutatók célzott fejlesztési stratégiákat javasolnak a diagramértelmezéshez.

A diagramok értelmezését részletesebben mérnék

Az EncQA célja, hogy a korábbi diagramértelmezési teszteknél rendszerezettebben fedje le a vizuális következtetés fontos területeit. Az Apple kutatói szerint a látó nyelvi modellek, vagyis a képi és szöveges információkat egyaránt feldolgozó rendszerek, folyamatosan jobb eredményeket érnek el a diagramok megértését vizsgáló benchmarkokon.

A kutatás következtetése szerint ezek a pontszámok önmagukban nem mutatják meg teljesen, milyen vizuális következtetési képességekre van szükség a diagramok értelmezéséhez. Az EncQA-t a vizualizációs szakirodalom alapján tervezték meg, hogy kiegyensúlyozottabb képet adjon a modellek teljesítményéről.

Hat vizuális csatorna és nyolc feladattípus

A benchmark 2076 szintetikus kérdés-válasz párból áll. Ezek hat vizuális kódolási csatornát fednek le: a pozíciót, a hosszúságot, a területet, a mennyiségi színt, a névleges színt és a formát.

A teszt nyolc feladattípust vizsgál. Ezek közé tartozik a szélsőértékek megtalálása, az értékek kiolvasása, a kiugró értékek felismerése, az értékek szűrése, valamint a levezetett értékek pontos és relatív kiszámítása. A benchmark emellett a korrelációk felismerését is méri, abszolút és relatív formában.

Az Apple oldalán közzétett tanulmány szerzői Kushin Mukherjee, Donghao Ren, Dominik Moritz és Yannick Assogba. Mukherjee Stanford Egyetemhez kötődik, a kutatási munkát pedig az Apple-nél végezte. A tanulmányt az IEEE Visualization konferencián mutatták be, a publikáció 2025 októberében jelent meg.

A nagyobb modell önmagában nem oldja meg a problémát

A kutatók kilenc korszerű látó nyelvi modellt értékeltek. Az eredmények jelentős eltéréseket mutattak ugyanazon feladaton belül az egyes vizuális kódolások között, és a különböző feladattípusok teljesítménye is számottevően változott.

A tanulmány egyik megállapítása szerint sok feladat és vizuális kódolás párosításánál a teljesítmény nem javult a modell méretének növelésével. Az eredmények alapján a diagramértelmezés fejlesztéséhez célzott stratégiákra lehet szükség, amelyek az egyes vizuális következtetési hiányosságokat kezelik. A kutatás így a modell vagy az adathalmaz puszta méretnövelése helyett a konkrét képességek külön vizsgálatát helyezi előtérbe.

Az EncQA a felhasználók számára azt jelentheti, hogy a diagramok értelmezésére képes modelleket részletesebb szempontok szerint lehet összehasonlítani. A benchmark külön választja például az értékek kiolvasását, a számításokat és a kapcsolatok felismerését, így pontosabban megmutathatja, mely feladatokban vannak eltérések a modellek között.

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a beszédmodellek nyelvi hátrányát az Apple

Az Apple kutatói vizuális információt vontak be kétnyelvű, önfelügyelt beszédmodellek tanításába. A módszerrel a fonetikai megkülönböztetésben mért teljesítménykülönbség…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…