A Novita AI-ra érkezett a Ling-3.0-Flash-VL multimodális modell

A Novita AI szerver nélküli végpontként kínálja a Ling-3.0-Flash-VL multimodális modellt, amely egyetlen API-munkafolyamatban kezel szöveges, képi és videós bemenetet. A használat 2026. szeptember 23-án 2:30 UTC-ig díjmentes.
- A Ling-3.0-Flash-VL szöveget, képet és videót fogad.
- A Novita AI telepítése 262 144 tokenes kontextust és 32 768 tokenes maximális kimenetet kínál.
- A modell 124 milliárd teljes és körülbelül 5,5 milliárd aktivált paraméterrel rendelkezik tokenenként.
- A bemeneti és kimeneti tokenek 2026. szeptember 23-án 2:30 UTC-ig díjmentesek.
- A modell képernyők, dokumentumok, diagramok és rövid videók elemzésére is tesztelhető.
Képet és videót is értelmez a Ling-3.0-Flash-VL
A Novita AI 2026. szeptember 9-i bejelentése szerint elérhetővé vált a Ling-3.0-Flash-VL, az InclusionAI Ling-3.0-flash családjának vizuális nyelvi modellje. A modell szöveget, képet és videót fogad bemenetként, válaszként pedig szöveget ad.
A -VL változat legfontosabb eltérése az alapmodellhez képest a natív vizuális megértés. A képi vagy videós információ a modell gondolkodási, tervezési, cselekvési és ellenőrzési folyamatának része maradhat, így a fejlesztőknek nem feltétlenül kell külön képfeliratozó vagy kép szöveggé alakító lépést beilleszteniük.
A Novita AI által közzétett modellazonosító: inclusionai/ling-3.0-flash-vl. A szolgáltatás chat/completions és Anthropic-kompatibilis végpontcsaládokat, továbbá következtetést és függvényhívást kínál.
124 milliárd paraméter, 262 144 tokenes kontextus
Az InclusionAI modellkártyája szerint a rendszer összesen 124 milliárd paraméteres, tokenenként pedig megközelítőleg 5,5 milliárd aktivált paraméterrel dolgozik. Ez ritka, Mixture-of-Experts felépítést jelent, amelynél a teljes paraméterszám és az egy tokenre jutó aktivált paraméterszám eltérő tulajdonságokat ír le.
A Novita AI telepítésének kontextusablaka 262 144 token, a maximális kimenet pedig 32 768 token. Ez eltér az upstream modellkártyán szereplő, legfeljebb egymillió tokenes modellszintű állítástól, ezért az integráció során a Novita AI által megadott korlátokat kell figyelembe venni. A katalógus alapértelmezett csomagja percenként 30 kérést engedélyez, a magasabb szintekhez külön értékek tartoznak.
A Novita AI jelenlegi listázása szerint a bemeneti és kimeneti tokenek ára egyaránt nulla 2026. szeptember 23-án 2:30 UTC-ig. A szolgáltató azt javasolja, hogy a fejlesztők a promóció lejárta előtt rögzítsék az aktuális árat, és készítsenek költségkorlátot a későbbi forgalomhoz.
Dokumentumok, képernyők és videók elemzésére használható
A modell olyan feladatokhoz lehet releváns, amelyeknél a válaszhoz vizuális bizonyíték is szükséges. Ilyen lehet a dokumentumok, táblázatok, diagramok és szoftveres felületek értelmezése, például egy képernyőkép mezőinek azonosítása vagy egy látható állapot összefoglalása.
A videós bemenet az időbeli változások elemzését is támogatja. A forrás szerint a modell vizuális kódolót és időbeli pozíciókezelést használ, ami olyan kérdéseknél lehet hasznos, amikor egy esemény időpontját, egy klip két részének különbségét vagy egy cselekvéssorozatot kell meghatározni.
A Novita AI a vizuális ügynököket is lehetséges felhasználási területként említi. Egy ilyen rendszer képernyőképet vizsgálhat, következő műveletet tervezhet, eszközt hívhat, majd ellenőrizheti a megváltozott felületet. A függvényhívás önmagában nem váltja ki az alkalmazásoldali biztonsági ellenőrzéseket, ezért a forrás a jogosultságok szűkítését és minden eszközargumentum ellenőrzését javasolja.
A fejlesztőknek saját feladatokon kell tesztelniük
Az InclusionAI modellkártyája 42-es pontszámot közöl az Artificial Analysis Intelligence Index v4.1.1 indexen. Ez az upstream modellre vonatkozó jelzés, és nem garantálja ugyanazt a teljesítményt a Novita AI telepítésén vagy egy konkrét alkalmazás kérdésein.
A forrás olyan teszteket javasol, amelyek külön mérik a képernyőképek, űrlapok, táblázatok és diagramok adatkinyerését, a videók időbeli értelmezését, az eszközválasztást és a végső állapotot, valamint az alá nem támasztott állításokat. A fejlesztőknek a késleltetést, a tokenhasználatot, a hibaarányt, a korlátozások kezelését és az újrapróbálkozások hatását is rögzíteniük kell.
Szöveges feladatokra továbbra is az alap Ling-3.0-flash lehet a megfelelő belépési pont, míg a -VL változatot a képet, videót vagy képernyőből származó állapotot tartalmazó kérésekhez érdemes értékelni. A szeptember 23-ig tartó díjmentes időszak lehetőséget ad reprezentatív tesztkészlet felépítésére, de a későbbi költségtervezéshez az árakat újra ellenőrizni kell.
Novita AI: Ling-3.0-Flash-VL on Novita AI: Native Multimodal API and Pricing


