Az Liquid AI új, gyors látónyelvi modellje telefonon is fut

Az Liquid AI kiadta az LFM2.5-VL-3B nevű, 3,1 milliárd paraméteres látónyelvi modellt, amelyet gyors, helyi futtatásra terveztek. A vállalat szerint a modell több, nála kétszer nagyobb rendszerhez mérhető képfeldolgozási teljesítményt kínál, miközben CPU-n és GPU-n is gyorsan működik.
- Az LFM2.5-VL-3B 3,1 milliárd paraméteres látónyelvi modell.
- A ScreenSpot-v2 átlagos eredménye 80,7 pont lett.
- A ToolSandbox pontszáma 26,4-ről 59,5-re javult.
- A modell körülbelül 3 GB memóriával helyi eszközökön is fut.
- Elérhető a Hugging Face-en, a Playgroundban és több futtatási környezetben.
Képernyők, dokumentumok és több kép értelmezése
Az LFM2.5-VL-3B a korábbi LFM2-VL-3B továbbfejlesztett változata. Az Liquid AI négy területen emel ki jelentős javulást: a digitális képernyők megértésében, a függvényhívásban, a képi tartalmakhoz kapcsolódó pozicionálásban, valamint a több képet érintő feladatokban.
A ScreenSpot-v2 teszten a modell átlagosan 80,7 pontot ért el. Ez meghaladta a nagyobb Gemma-4-E4B 51,2 pontos és a Qwen 3.5 4B 78,5 pontos eredményét, miközben az InternVL-3.5-4B 84,1 ponttal végzett előtte. A modell asztali, mobil- és webes felületeket is kezel.
A pozicionálási teljesítményt mérő RefCOCO precision@1 eredménye 57,1-ről 87,9-re nőtt az előző kiadáshoz képest. A több képes feladatokat vizsgáló BLINK pontszáma 50,2-ről 61,5-re, a MUIRBench eredménye pedig 34,9-ről 58,3-ra javult.
Erősebb eszközhasználat és új képzési alapok
Az LFM2.5-VL-3B az Liquid AI látónyelvi modelljei között elsőként kapott hangsúlyosabb támogatást az eszközhasználathoz és a függvényhíváshoz. A ToolSandbox teszten 26,4-ről 59,5-re emelkedett a pontszáma, a BFCL v4 eredménye pedig 20,5-ről 32,5-re javult. A vállalat szerint ezen a területen a modell a Gemma-4-E2B szintjén van, és megelőzi a Qwen3.5-2B-t.
A rendszer nem következtető modell, közvetlen válaszokra készült, így az Liquid AI szerint alacsony késleltetéssel használható valós idejű és eszközön futó alkalmazásokban. A modell ugyanazt az előre betanított alapot használja, mint az LFM2.5-2.6B szöveges modell, és egy 400 millió paraméteres SigLIP2 NaFlex képkódolót integrál.
A korábbi LFM2-VL-3B kiadáshoz képest nagyjából 34 billió tokenen történt az előtanítás. A nem latin betűs írásrendszerek jobb támogatására a szókészletet 128 ezer eleműre bővítették, a látási előtanításban használt tokenek mennyiségét pedig négyszeresére növelték.
Helyi futtatás számítógépen és telefonon
Az LFM2.5-VL-3B elérhető a Hugging Face felületén és az Liquid AI Playground szolgáltatásában. A vállalat dokumentációt is közöl a helyi futtatáshoz és a finomhangoláshoz. A modellhez a bejelentés szerint már az első naptól támogatást kapott a llama.cpp, az MLX, a vLLM, az SGLang és az ONNX.
A vállalat mérései szerint a modell Apple M5 Max processzoron másodpercenként 228, AMD Ryzen AI Max+ 395 processzoron pedig 116 tokent dekódol, miközben körülbelül 3 GB memóriát használ. Egy Galaxy S26 Ultra telefonon 20 token másodpercenkénti sebességet mértek. A modell a böngészős WebGPU bemutatóban is kipróbálható, ahol a feldolgozás teljes egészében az eszközön történik.
Egyetlen NVIDIA H100 SXM5 GPU-n, öt képkockás videoklip esetén az első token körülbelül 34 ezredmásodperc alatt érkezett meg. Nagy terhelés mellett a modell körülbelül 11 ezer kimeneti tokent ért el másodpercenként. Az Liquid AI szerint ez a tesztelt rendszerek között a legmagasabb kimeneti teljesítmény volt, és nagyjából kétszerese a nagyobb, 4 milliárd paraméteres modellekének.


