Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Roboflow szerint a Qwen3.8-Max vezeti a vizuális teszteket

2026. augusztus 6.Forrás: Roboflow
A Roboflow szerint a Qwen3.8-Max vezeti a vizuális teszteket
Kép: Roboflow

A Qwen3.8-Max a Roboflow tesztjeiben a legerősebb vizuális nyelvi modellnek bizonyult objektumfelismerésben. A 2,4 billió paraméteres modell már elérhető az Alibaba Cloud API-ján, nyílt súlyai pedig augusztus 12-én érkezhetnek.

A lényeg röviden
  • A Roboflow benchmarkjában a Qwen3.8-Max érte el a legjobb objektumfelismerési eredményt.
  • A modell 2,4 billió paraméteres, és lekérdezésenként körülbelül 95 milliárd paramétert aktivál.
  • Objektumszámlálásban a Gemini 3.6 Flash modellel holtversenyben végzett az első helyen.
  • Adatkinyerésben a rangsor tizedik helyére került, körülbelül 10 százalékpontos lemaradással.
  • A Qwen3.8-Max nyílt súlyai és a Qwen3.8-27B augusztus 12-én jelenhetnek meg.

Kiemelkedő objektumfelismerés többféle képen

Az Alibaba által fejlesztett Qwen3.8-Max szöveget, képet és videót fogad bemenetként, válaszként pedig szöveget ad. A modell Mixture-of-Experts architektúrát használ, a 2,4 billió teljes paraméterből lekérdezésenként körülbelül 95 milliárdot aktivál.

A Roboflow augusztus 6-án közzétett tesztje szerint a Qwen3.8-Max érte el a legjobb objektumfelismerési eredményt a vállalat készülő vizuális nyelvimodell-benchmarkjában. A modell műholdfelvételeken, infravörös képeken, dokumentumokon, műszaki rajzokon, kézzel készített vázlatokon, diagramokon, zsúfolt jeleneteken és kis objektumokat tartalmazó képeken is jól teljesített.

A vizsgálat során a modellnek JSON-listában kellett visszaadnia az objektumok címkéjét és négy koordinátáját. A Roboflow szerint a kért formátum jelentősen befolyásolja a pontosságot. A Qwen-modellek az XYXY koordinátákkal teljesítettek a legjobban, a koordinátákat pedig 0 és 1000 közötti tartományban kellett megadni.

A példával megadott célpontok is működtek

A modellnek szöveges leírás helyett egy kijelölt objektumot tartalmazó keretet is lehetett adni. Ezután az összes hasonló objektumot kellett megtalálnia. A módszer olyan esetekben lehet hasznos, amikor a célpontot nehéz szavakkal leírni, például az alakja, textúrája, sérülése vagy iránya alapján.

A Roboflow pozitív és negatív kereteket is tesztelt. A pozitív keretek a keresendő objektumokat, a negatív keretek pedig azokat a hasonló tárgyakat jelölték, amelyeket figyelmen kívül kellett hagyni. A képre közvetlenül berajzolt keretek kissé jobb eredményt adtak, 80,8 százalékos mAP értékkel.

Egyetlen kijelölt objektum azonban félrevezető lehetett. Egy futballos példában a modell a megjelölt játékos csapattársait kereste az összes játékos helyett, egy Lego-képen pedig a tégla színét követte az alakja helyett.

Objektumszámlálásban a Qwen3.8-Max holtversenyben végzett az első helyen a Gemini 3.6 Flash modellel. Összetett képi kérdéseknél is jól teljesített, de zsúfolt jelenetekben és finom kategóriakülönbségeknél hibázott. Egy fémdarabokat számláló feladatban 10 darabot becsült, miközben a helyes érték 12 volt.

Az adatkinyerés gyengébb, a futtatás költségesebb lehet

A vizuális következtetési feladatokban, amelyek képfelismerést, szabályokat, kapcsolatokat vagy számításokat igényeltek, a modell a Roboflow értékelésében a második helyet szerezte meg a Gemini 3.5 Flash mögött. A tesztek között gyógyszeres dobozok ellenőrzése, rendelési csomagok tartalmának vizsgálata és nyugtákon végzett számítások is szerepeltek.

A célzott adatkinyerés viszont egyértelmű gyengeségnek bizonyult. A Qwen3.8-Max a rangsor tizedik helyén végzett, körülbelül 10 százalékponttal lemaradva olyan modellektől, mint a Gemini 3.5 Flash, a Claude Sonnet és a Muse Spark 1.2. Kézírásos jegyzetekből és gyógyszeres csomagolásokról megadott helyen szereplő dátumokat kellett kiolvasnia, de időnként félreolvasta vagy kitalálta az értéket.

A teljes modell adatközponti infrastruktúrát igényel, ezért a legtöbb felhasználó várhatóan API-n keresztül éri majd el. Az Alibaba augusztus 12-re tervezi a Qwen3.8-Max nyílt súlyainak kiadását, ugyanakkor egy sűrű, 27 milliárd paraméteres Qwen3.8-27B modellt is közzétesz. Ez a kisebb változat alkalmasabb lehet helyi futtatásra, kvantálásra és finomhangolásra, de egyelőre nem ismert, mennyire közelíti meg a Max teljesítményét.

A Roboflow szerint a Qwen3.8-Max ára hasonló tartományban van, mint a Muse Spark 1.2, a Claude Sonnet és a Gemini 3.5 Flash ára a benchmarkban. A késleltetés nagyobb kompromisszumot jelentett, a modell a tesztelt rendszerek között a leglassabbak közé tartozott, és átlagosan tovább dolgozott, mint a GPT-5.6 és a Claude Fable. Offline feldolgozásnál és annotálásnál ez elfogadható lehet, valós idejű rendszerekben viszont gyorsabb modellre vagy válogatott képeket feldolgozó megoldásra lehet szükség.

Kapcsolódó hírek

Roboflow Labs néven új kutatási részleget indít a Roboflow
Kutatás2026. szeptember 30.

Roboflow Labs néven új kutatási részleget indít a Roboflow

Roboflow Labs néven alkalmazott kutatási részleget indít a Roboflow. A divízió olyan modellek és értékelési módszerek fejlesztésére összpontosít, amelyek a mesterséges…

A Roboflow szerint a GPT-6 Astra a legerősebb látásmodell
Kutatás2026. szeptember 18.

A Roboflow szerint a GPT-6 Astra a legerősebb látásmodell

A Roboflow tesztjei alapján a GPT-6 Astra eddig a legerősebb látásmodell, amelyet a vállalat vizsgált. A modell objektumfelismerésben, számlálásban és vizuális…

A Roboflow Playgroundban 134 számítógépes látásmodellt lehet összevetni
Termékek és eszközök2026. augusztus 27.

A Roboflow Playgroundban 134 számítógépes látásmodellt lehet összevetni

A Roboflow Playground ugyanazt a képet és promptot akár öt, összesen 134 támogatott számítógépes látásmodellnek adja át párhuzamosan. Az ingyenes környezetben többek…