Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell

2026. szeptember 24.Forrás: Hugging Face
Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell
Kép: Hugging Face

A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást, amely a képet és szöveget is kezelő modellek következtetését gyorsíthatja. A közzétett adatok szerint a gyorsulás eszközön akár 3,13-szoros, H100 grafikus processzoron pedig 2,66-szoros lehet.

A lényeg röviden
  • A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást.
  • A közölt adatok szerint az eszközön mért gyorsulás akár 3,13-szoros lehet.
  • H100 grafikus processzoron a forrás legfeljebb 2,66-szoros gyorsulást említ.
  • A módszer a képrészleteket és a szöveges tokeneket közös reprezentációba vetíti.
  • A projekt támogatja a llama.cpp, az MLX-VLM és az SGLang keretrendszereket.

A spekulatív dekódolást viszi át a képek világába

Az LFM2.5-VL-DSpark az LFM2.5-VL látás-nyelvi modellhez kapcsolódó gyorsítási megoldás. A Hugging Face-en közzétett anyag szerint a módszer a korábbi, szöveges LFM2.5-DSpark modellekben használt megközelítésre épít.

A rendszer egy úgynevezett látási javaslattevőt használ. Ez a célmodell rejtett állapotait rögzíti a modell meghatározott rétegeiben, majd ezek alapján több lehetséges tokent készít elő. A célmodell ezeket a jelölteket ellenőrzi, így a következtetés során egy lépésben nagyobb tokenblokk feldolgozása válhat lehetővé.

A Hugging Face közösségi oldalán szereplő magyarázat szerint a képpontokból származó képrészleteket és a szöveges tokeneket közös reprezentációba vetítik. Emiatt a javaslattevő mindkét bemeneti típusnál azonos dimenziójú rejtett állapotvektorokkal dolgozik, miközben a következtetési algoritmus változatlan marad a szöveges modellekhez képest.

A közzétett mérések szerint jelentős gyorsulást kínál

A projektoldalhoz kapcsolódó anyag címe legfeljebb 3,2-szer gyorsabb következtetést emel ki az LFM2.5-DSpark kapcsán. A látás-nyelvi változatról szóló közösségi magyarázat konkrétan legfeljebb 3,13-szoros gyorsulást említ eszközön, H100 használatakor pedig 2,66-szoros értéket.

Ezeket a számokat a forrás a módszer bemutatásakor közli, ezért a tényleges eredmény az adott hardvertől és munkaterheléstől is függhet. A leírás szerint a cél a következtetés gyorsítása a kimenet minőségének megváltoztatása nélkül, miközben a többlet memóriaigény viszonylag kicsi marad.

Az LFM2.5-VL-DSpark kísérleti modellként jelenik meg. A forrás nem közöl általános teljesítményígéretet minden hardverre vagy feladatra, ezért a megadott értékek a bemutatott mérési környezethez kapcsolódó eredményekként értelmezhetők.

A fejlesztők több környezetben kipróbálhatják

A projekt már az első napon támogatást kapott a llama.cpp, az MLX-VLM és az SGLang keretrendszerekhez. Ez lehetőséget ad a fejlesztőknek arra, hogy a gyorsított látás-nyelvi következtetést több, eltérő célú futtatási környezetben vizsgálják.

A Hugging Face-en megjelent értékelés szerint a közös reprezentáció miatt a DSpark megközelítése újrahasznosítható módon viheti tovább a szöveges modelleknél alkalmazott spekulatív dekódolást a látás-nyelvi rendszerekhez. A felhasználók számára ez gyorsabb képes kérdésválaszolást és egyéb, képet és szöveget együtt kezelő feladatokat jelenthet, de a forrás ezekre nem közöl külön teljesítményméréseket.

A gyakorlati eredményeket a különböző hardverek és munkaterhelések is befolyásolhatják. A projekt fejlesztési iránya ugyanakkor azt mutatja, hogy a modellgyorsítás egyre inkább a látás-nyelvi rendszerek futtatására is kiterjed.

Kapcsolódó hírek

Kimi K3: Claude-klón vagy önálló fejlesztés?
Modellek2026. október 2.

Kimi K3: Claude-klón vagy önálló fejlesztés?

A Moonshot AI Kimi K3 modellje 2,8 billió paraméterével az első nyílt súlyú modell ezen a méreten. A megjelenés után felmerült, hogy a fejlesztés Anthropic-modellből…

AI-model segítheti az Alzheimer-kór korai felismerését
Kutatás2026. szeptember 28.

AI-model segítheti az Alzheimer-kór korai felismerését

A Cambridge-i Egyetem kutatói olyan mesterségesintelligencia-modellt fejlesztettek, amely MRI-felvételek és más klinikai adatok együttes elemzésével segítheti az agyi…

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol
Modellek2026. szeptember 24.

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol

A Liquid AI bemutatta az LFM2.5-VL-DSpark kísérleti modellt, amely az LFM2.5-VL-3B látásnyelvi modell dekódolását gyorsítja. A vállalat mérései szerint a dekódolási…