Külön fast modellt kapott a Ling-3.0-flash a Novita AI-nál

A Novita AI külön szerver nélküli modellazonosítóként tette elérhetővé a Ling-3.0-flash-fast változatot. A nyilvános adatok szerint az alapmodellhez képest ugyanazt a kontextusablakot, kimeneti korlátot, funkciókat és tokenárakat kínálja.
- A Novita AI külön modellazonosítóként kínálja a Ling-3.0-flash-fast változatot.
- Mindkét modell 256K kontextusablakot és 32K maximális kimenetet kínál.
- A bemeneti ár 0,06, a kimeneti ár 0,18 dollár egymillió tokenenként.
- A nyilvános források nem közölnek külön benchmarkot vagy számszerű késleltetési előnyt.
- A két változat összehasonlítását a fejlesztőknek saját feladataikon kell elvégezniük.
Külön végpont a Ling-3.0-flash családon belül
A Ling-3.0-flash-fast a Novita AI kínálatában az inclusionai/ling-3.0-flash-fast modellazonosítóval szerepel. A szolgáltató ezt a Ling-3.0-flash család külön hosztolt változataként kínálja, így a fejlesztőcsapatok önálló célpontként tesztelhetik.
A modelloldal leírása ugyanahhoz a családi pozicionáláshoz kapcsolódik, mint az alapmodellé. Ez egy 124 milliárd paraméteres, szakértői keverék (Mixture-of-Experts, MoE) architektúra, amely tokenenként hozzávetőleg 5,1 milliárd aktív paraméterrel dolgozik. A Ling-3.0-flash családot a forrás a tokenhatékonyságra és a nagy léptékű, ügynökalapú következtetésre szánt modellként írja le.
A „fast” elnevezés alapján feltételezhető egy késleltetésre optimalizált kiszolgálási profil, ezt azonban a Novita AI nem támasztja alá számszerű ígérettel. A szolgáltató nem közöl külön mérési táblázatot, százalékos gyorsulást vagy az első tokenig eltelt időre vonatkozó eltérést az alapmodellhez képest.
Az árak és a technikai korlátok megegyeznek
A Novita AI 2026. augusztus 19-én ellenőrzött modelloldalai alapján a Ling-3.0-flash-fast és a ling-3.0-flash azonos nyilvános paraméterekkel szerepelnek. Mindkét változat 256 ezres kontextusablakot, legfeljebb 32 ezer tokenes kimenetet, következtetési és függvényhívási támogatást, valamint csevegéskiegészítési lehetőséget kínál.
Az ár mindkét modellnél 0,06 dollár egymillió bemeneti tokenenként, a gyorsítótárból olvasott tokenek díja 0,012 dollár egymillió tokenenként, a kimeneti tokeneké pedig 0,18 dollár egymillió tokenenként. A modelloldalon feltüntetett, fiókszinttől függő kéréskorlátok 30 és 6000 RPM között mozognak.
A Ling-3.0-flash-fast platformon jelzett kiadási dátuma 2026. július 24. A forrás szerint a korábbi, július végi, nulla áras állapot már nem irányadó: augusztus 19-én mindkét változat fizetős szerver nélküli modellként szerepelt.
A választást saját mérésekre érdemes alapozni
A Novita AI OpenAI-kompatibilis API-t biztosít a modellekhez. Az alap URL https://api.novita.ai/openai, a csevegéskiegészítési kérések pedig a POST /v1/chat/completions útvonalon érhetők el.
Ez lehetővé teszi, hogy a fejlesztők a megszokott API-felület módosítása nélkül hasonlítsák össze a két modellazonosítót. A fast változat kipróbálható például ügynöki folyamatokban, eszközhívásoknál, hosszú dokumentumok feldolgozásánál vagy többfordulós munkamenetekben.
A nyilvános források jelenleg nem igazolnak külön teljesítményelőnyt. Nincs közzétett, kizárólag a flash-fast változatra vonatkozó benchmark, késleltetési szolgáltatási szint, elsőtoken-idő adat, eltérő architektúraleírás vagy alacsonyabb ár. Emiatt a modell kiválasztását a saját feladatokon végzett összehasonlító tesztnek kell eldöntenie.
A Novita AI szerint a fast változat akkor lehet érdemi tesztjelölt, ha egy csapat már használja a Ling-3.0-flash képességeit, de az interakciók sebességén szeretne javítani. Ha nincs bizonyított késleltetési probléma, vagy fontos a meglévő értékelések reprodukálhatósága, az alapmodell használata maradhat a konzervatívabb kiindulópont.


