A Roboflow szerint a Qwen3.8-Max vezeti a vizuális teszteket

A Qwen3.8-Max a Roboflow tesztjeiben a legerősebb vizuális nyelvi modellnek bizonyult objektumfelismerésben. A 2,4 billió paraméteres modell már elérhető az Alibaba Cloud API-ján, nyílt súlyai pedig augusztus 12-én érkezhetnek.
- A Roboflow benchmarkjában a Qwen3.8-Max érte el a legjobb objektumfelismerési eredményt.
- A modell 2,4 billió paraméteres, és lekérdezésenként körülbelül 95 milliárd paramétert aktivál.
- Objektumszámlálásban a Gemini 3.6 Flash modellel holtversenyben végzett az első helyen.
- Adatkinyerésben a rangsor tizedik helyére került, körülbelül 10 százalékpontos lemaradással.
- A Qwen3.8-Max nyílt súlyai és a Qwen3.8-27B augusztus 12-én jelenhetnek meg.
Kiemelkedő objektumfelismerés többféle képen
Az Alibaba által fejlesztett Qwen3.8-Max szöveget, képet és videót fogad bemenetként, válaszként pedig szöveget ad. A modell Mixture-of-Experts architektúrát használ, a 2,4 billió teljes paraméterből lekérdezésenként körülbelül 95 milliárdot aktivál.
A Roboflow augusztus 6-án közzétett tesztje szerint a Qwen3.8-Max érte el a legjobb objektumfelismerési eredményt a vállalat készülő vizuális nyelvimodell-benchmarkjában. A modell műholdfelvételeken, infravörös képeken, dokumentumokon, műszaki rajzokon, kézzel készített vázlatokon, diagramokon, zsúfolt jeleneteken és kis objektumokat tartalmazó képeken is jól teljesített.
A vizsgálat során a modellnek JSON-listában kellett visszaadnia az objektumok címkéjét és négy koordinátáját. A Roboflow szerint a kért formátum jelentősen befolyásolja a pontosságot. A Qwen-modellek az XYXY koordinátákkal teljesítettek a legjobban, a koordinátákat pedig 0 és 1000 közötti tartományban kellett megadni.
A példával megadott célpontok is működtek
A modellnek szöveges leírás helyett egy kijelölt objektumot tartalmazó keretet is lehetett adni. Ezután az összes hasonló objektumot kellett megtalálnia. A módszer olyan esetekben lehet hasznos, amikor a célpontot nehéz szavakkal leírni, például az alakja, textúrája, sérülése vagy iránya alapján.
A Roboflow pozitív és negatív kereteket is tesztelt. A pozitív keretek a keresendő objektumokat, a negatív keretek pedig azokat a hasonló tárgyakat jelölték, amelyeket figyelmen kívül kellett hagyni. A képre közvetlenül berajzolt keretek kissé jobb eredményt adtak, 80,8 százalékos mAP értékkel.
Egyetlen kijelölt objektum azonban félrevezető lehetett. Egy futballos példában a modell a megjelölt játékos csapattársait kereste az összes játékos helyett, egy Lego-képen pedig a tégla színét követte az alakja helyett.
Objektumszámlálásban a Qwen3.8-Max holtversenyben végzett az első helyen a Gemini 3.6 Flash modellel. Összetett képi kérdéseknél is jól teljesített, de zsúfolt jelenetekben és finom kategóriakülönbségeknél hibázott. Egy fémdarabokat számláló feladatban 10 darabot becsült, miközben a helyes érték 12 volt.
Az adatkinyerés gyengébb, a futtatás költségesebb lehet
A vizuális következtetési feladatokban, amelyek képfelismerést, szabályokat, kapcsolatokat vagy számításokat igényeltek, a modell a Roboflow értékelésében a második helyet szerezte meg a Gemini 3.5 Flash mögött. A tesztek között gyógyszeres dobozok ellenőrzése, rendelési csomagok tartalmának vizsgálata és nyugtákon végzett számítások is szerepeltek.
A célzott adatkinyerés viszont egyértelmű gyengeségnek bizonyult. A Qwen3.8-Max a rangsor tizedik helyén végzett, körülbelül 10 százalékponttal lemaradva olyan modellektől, mint a Gemini 3.5 Flash, a Claude Sonnet és a Muse Spark 1.2. Kézírásos jegyzetekből és gyógyszeres csomagolásokról megadott helyen szereplő dátumokat kellett kiolvasnia, de időnként félreolvasta vagy kitalálta az értéket.
A teljes modell adatközponti infrastruktúrát igényel, ezért a legtöbb felhasználó várhatóan API-n keresztül éri majd el. Az Alibaba augusztus 12-re tervezi a Qwen3.8-Max nyílt súlyainak kiadását, ugyanakkor egy sűrű, 27 milliárd paraméteres Qwen3.8-27B modellt is közzétesz. Ez a kisebb változat alkalmasabb lehet helyi futtatásra, kvantálásra és finomhangolásra, de egyelőre nem ismert, mennyire közelíti meg a Max teljesítményét.
A Roboflow szerint a Qwen3.8-Max ára hasonló tartományban van, mint a Muse Spark 1.2, a Claude Sonnet és a Gemini 3.5 Flash ára a benchmarkban. A késleltetés nagyobb kompromisszumot jelentett, a modell a tesztelt rendszerek között a leglassabbak közé tartozott, és átlagosan tovább dolgozott, mint a GPT-5.6 és a Claude Fable. Offline feldolgozásnál és annotálásnál ez elfogadható lehet, valós idejű rendszerekben viszont gyorsabb modellre vagy válogatott képeket feldolgozó megoldásra lehet szükség.


