Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Liquid AI új, gyors látónyelvi modellje telefonon is fut

2026. augusztus 12.Forrás: Liquid AI
Az Liquid AI új, gyors látónyelvi modellje telefonon is fut
Kép: Liquid AI

Az Liquid AI kiadta az LFM2.5-VL-3B nevű, 3,1 milliárd paraméteres látónyelvi modellt, amelyet gyors, helyi futtatásra terveztek. A vállalat szerint a modell több, nála kétszer nagyobb rendszerhez mérhető képfeldolgozási teljesítményt kínál, miközben CPU-n és GPU-n is gyorsan működik.

A lényeg röviden
  • Az LFM2.5-VL-3B 3,1 milliárd paraméteres látónyelvi modell.
  • A ScreenSpot-v2 átlagos eredménye 80,7 pont lett.
  • A ToolSandbox pontszáma 26,4-ről 59,5-re javult.
  • A modell körülbelül 3 GB memóriával helyi eszközökön is fut.
  • Elérhető a Hugging Face-en, a Playgroundban és több futtatási környezetben.

Képernyők, dokumentumok és több kép értelmezése

Az LFM2.5-VL-3B a korábbi LFM2-VL-3B továbbfejlesztett változata. Az Liquid AI négy területen emel ki jelentős javulást: a digitális képernyők megértésében, a függvényhívásban, a képi tartalmakhoz kapcsolódó pozicionálásban, valamint a több képet érintő feladatokban.

A ScreenSpot-v2 teszten a modell átlagosan 80,7 pontot ért el. Ez meghaladta a nagyobb Gemma-4-E4B 51,2 pontos és a Qwen 3.5 4B 78,5 pontos eredményét, miközben az InternVL-3.5-4B 84,1 ponttal végzett előtte. A modell asztali, mobil- és webes felületeket is kezel.

A pozicionálási teljesítményt mérő RefCOCO precision@1 eredménye 57,1-ről 87,9-re nőtt az előző kiadáshoz képest. A több képes feladatokat vizsgáló BLINK pontszáma 50,2-ről 61,5-re, a MUIRBench eredménye pedig 34,9-ről 58,3-ra javult.

Erősebb eszközhasználat és új képzési alapok

Az LFM2.5-VL-3B az Liquid AI látónyelvi modelljei között elsőként kapott hangsúlyosabb támogatást az eszközhasználathoz és a függvényhíváshoz. A ToolSandbox teszten 26,4-ről 59,5-re emelkedett a pontszáma, a BFCL v4 eredménye pedig 20,5-ről 32,5-re javult. A vállalat szerint ezen a területen a modell a Gemma-4-E2B szintjén van, és megelőzi a Qwen3.5-2B-t.

A rendszer nem következtető modell, közvetlen válaszokra készült, így az Liquid AI szerint alacsony késleltetéssel használható valós idejű és eszközön futó alkalmazásokban. A modell ugyanazt az előre betanított alapot használja, mint az LFM2.5-2.6B szöveges modell, és egy 400 millió paraméteres SigLIP2 NaFlex képkódolót integrál.

A korábbi LFM2-VL-3B kiadáshoz képest nagyjából 34 billió tokenen történt az előtanítás. A nem latin betűs írásrendszerek jobb támogatására a szókészletet 128 ezer eleműre bővítették, a látási előtanításban használt tokenek mennyiségét pedig négyszeresére növelték.

Helyi futtatás számítógépen és telefonon

Az LFM2.5-VL-3B elérhető a Hugging Face felületén és az Liquid AI Playground szolgáltatásában. A vállalat dokumentációt is közöl a helyi futtatáshoz és a finomhangoláshoz. A modellhez a bejelentés szerint már az első naptól támogatást kapott a llama.cpp, az MLX, a vLLM, az SGLang és az ONNX.

A vállalat mérései szerint a modell Apple M5 Max processzoron másodpercenként 228, AMD Ryzen AI Max+ 395 processzoron pedig 116 tokent dekódol, miközben körülbelül 3 GB memóriát használ. Egy Galaxy S26 Ultra telefonon 20 token másodpercenkénti sebességet mértek. A modell a böngészős WebGPU bemutatóban is kipróbálható, ahol a feldolgozás teljes egészében az eszközön történik.

Egyetlen NVIDIA H100 SXM5 GPU-n, öt képkockás videoklip esetén az első token körülbelül 34 ezredmásodperc alatt érkezett meg. Nagy terhelés mellett a modell körülbelül 11 ezer kimeneti tokent ért el másodpercenként. Az Liquid AI szerint ez a tesztelt rendszerek között a legmagasabb kimeneti teljesítmény volt, és nagyjából kétszerese a nagyobb, 4 milliárd paraméteres modellekének.

Kapcsolódó hírek

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell
Kutatás2026. szeptember 24. 16:08

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell

A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást, amely a képet és szöveget is kezelő modellek következtetését gyorsíthatja. A közzétett adatok szerint a gyorsulás…

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol
Modellek2026. szeptember 24.

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol

A Liquid AI bemutatta az LFM2.5-VL-DSpark kísérleti modellt, amely az LFM2.5-VL-3B látásnyelvi modell dekódolását gyorsítja. A vállalat mérései szerint a dekódolási…

A kódoló ügynököknek iteráció kellett a gyártásérett feladathoz
Fejlesztőknek2026. augusztus 18.

A kódoló ügynököknek iteráció kellett a gyártásérett feladathoz

A Liquid AI két kódoló ügynökkel próbált a semmiből gyártásérett BPE-tokenizáló-trénert készíttetni. Az első prototípusok fél órán belül elkészültek, de a teljes…