Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Liquid AI DSpark modelljei akár 3,18-szoros gyorsulást ígérnek

2026. augusztus 20.Forrás: Liquid AI
A Liquid AI DSpark modelljei akár 3,18-szoros gyorsulást ígérnek
Kép: Liquid AI

A Liquid AI elérhetővé tette három LFM2.5 modell DSpark változatát, amelyek a vállalat mérései szerint akár 3,18-szoros átviteli sebességet kínálnak GPU-n, és akár 2,87-szereset helyi eszközökön. A modellek a spekulatív dekódolást használják, miközben a cég szerint a kimenet minősége nem változik.

A lényeg röviden
  • A Liquid AI három LFM2.5 modellhez adott ki DSpark változatot.
  • A vállalat szerint a gyorsulás GPU-n akár 3,18-szoros, helyi eszközön akár 2,87-szeres.
  • Az LFM2.5-2.6B M4 Maxon átlagosan 57 százalékkal csökkentette a függvényhívási késleltetést.
  • A DSpark modellek elérhetők a Hugging Face-en, támogatásuk bekerült a llama.cpp és az SGLang projektbe.
  • Az LFM2.5-8B-A1B helyi eszközön csak 18 százalékos átlagos javulást ért el.

Három LFM2.5 modell kapott DSpark változatot

A Liquid AI augusztus 20-án tette közzé az LFM2.5-1.2B-Instruct, az LFM2.5-2.6B és az LFM2.5-8B-A1B DSpark draft modelljeit. A vállalat szerint ezek a változatok minimális memóriaigény-növekedés mellett gyorsítják a dekódolást. Ez a Liquid Foundation Models első nyilvános spekulatív dekódolási modellkiadása.

A modellek elérhetők a Hugging Face-en. A hozzájuk tartozó, LFM-kompatibilis DSpark-integráció bekerült a llama.cpp és az SGLang nyílt forráskódú projektbe is. A futtatási részleteket a modellkártyák ismertetik.

Könnyű draft modell ellenőrzi a tokeneket

A spekulatív dekódolás alapötlete, hogy egy kisebb, könnyű modell előre elkészíti a lehetséges tokeneket, amelyeket a célmodell egyetlen előremeneti lépésben ellenőriz. Így a rendszer több token között osztja meg a súlyok betöltésének költségét. A Liquid AI szerint a dekódolási szakasz jellemzően memóriaigényes, mivel a rendszer a súlyokat a DRAM-ból az SRAM-ba továbbítja. Ez a vállalat szerint nagy teljesítményű GPU-kon, például az NVIDIA H100-on, és olyan helyi eszközökön is igaz, mint a MacBook vagy az iPhone.

A DSpark három fő elemet kombinál. A DFlash-stílusú párhuzamos gerincmodell a célmodell kontextusjellemzőire támaszkodik, a szekvenciális fej pedig a szomszédos tokenek közötti Markov-láncként működik. Emellett egy bizalomalapú ellenőrző előrejelzi az egyes tokenek elfogadásának valószínűségét, majd a hardverhez igazított ütemező elhagyja az alacsony biztonságú tokenfolytatásokat.

A draft modellek körülbelül 300 millió paraméteresek. A végleges változatok kiválasztásánál az elfogadási arányt vették alapul, nem kizárólag a validációs veszteséget. A tanítást és a kísérleteket kizárólag AMD hardveren végezték. A modellek öt réteget és kilences blokkméretet használnak.

H100-on és MacBookon is mértek gyorsulást

A Liquid AI az LFM2.5-2.6B esetében egyetlen, 80 GB-os H100 GPU-n, valamint egy M4 Max chippel szerelt MacBook Prón végzett méréseket. A tesztek FP16, illetve BF16 formátumot, egyes kötegméretet, nulla hőmérsékletet és legfeljebb 256 kimeneti tokent használtak. Öt adathalmazon, a MATH500, GSM8K, HumanEval, MBPP és MT-Bench teszteken a modell átlagos gyorsulása 2,67-szoros volt H100-on, illetve 2,27-szeres M4 Maxon. Az átlagos teljesítmény 323-ról 864 tokenre nőtt másodpercenként H100-on, MacBookon pedig 61-ről 139 tokenre.

Az LFM2.5-1.2B-Instruct átlagosan 2,10-szeres gyorsulást ért el H100-on, és 2,54-szereset M4 Maxon. A mért átlagos sebesség 656-ról 1384 tokenre, illetve 138-ról 350 tokenre nőtt másodpercenként. A vállalat szerint ennél a modellnél az adathalmaztól függően akár 52 százalékos eltérés is lehet a gyorsulásban.

Az LFM2.5-8B-A1B esetében a GPU-s átlagos gyorsulás 2,54-szeres volt, helyi eszközön azonban csak 18 százalékos javulást mértek. A Liquid AI ezt a llama.cpp Metal-alapú MoE-megvalósításával, valamint azzal magyarázza, hogy több token ellenőrzése több szakértő aktiválásával és nagyobb súlyforgalommal jár.

A gyorsulás az ügynöki feladatoknál is számít

A Liquid AI az LFM2.5-2.6B modellt olyan helyi ügynöki feladatokra szánta, amelyekben a modell minden eszközhívás előtt következtet. A BFCL adathalmazon végzett, több eszközt használó függvényhívási tesztekben a DSpark átlagosan 57 százalékkal csökkentette a késleltetést M4 Max MacBook Prón.

Greedy dekódolásnál a draft token csak akkor kerül a kimenetbe, ha egyezik a célmodell eloszlásával. Elutasítás esetén a célmodell saját tokenje váltja fel, ezért a Liquid AI szerint a kibocsátott szekvencia megegyezik az alap greedy dekódolás eredményével, így a pass@1 vagy exact match típusú pontosság változatlan marad.

Kapcsolódó hírek

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell
Kutatás2026. szeptember 24.

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell

A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást, amely a képet és szöveget is kezelő modellek következtetését gyorsíthatja. A közzétett adatok szerint a gyorsulás…

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol
Modellek2026. szeptember 24.

A Liquid AI látásmodellje akár 3,13-szor gyorsabban dekódol

A Liquid AI bemutatta az LFM2.5-VL-DSpark kísérleti modellt, amely az LFM2.5-VL-3B látásnyelvi modell dekódolását gyorsítja. A vállalat mérései szerint a dekódolási…

A Liquid AI új 4 bites modelljei visszanyerik a pontosság nagy részét
Modellek2026. augusztus 19.

A Liquid AI új 4 bites modelljei visszanyerik a pontosság nagy részét

A Liquid AI négy új, 4 bites LFM2.5 checkpointot adott ki, amelyeket kvantálástudatos desztillációval, QAD-del készített. A vállalat szerint a modellek megtartják a Q4_0…