A Liquid AI új 4 bites modelljei visszanyerik a pontosság nagy részét

A Liquid AI négy új, 4 bites LFM2.5 checkpointot adott ki, amelyeket kvantálástudatos desztillációval, QAD-del készített. A vállalat szerint a modellek megtartják a Q4_0 formátum alacsony memóriaigényét és nagy sebességét, miközben a BF16 változatok teljesítményének körülbelül 97 százalékát hozzák.
- Négy LFM2.5 modell kapott QAD-del betanított, 4 bites Q4_0 checkpointot.
- A modellek a BF16 változatok teljesítményének körülbelül 97 százalékát érték el.
- A QAD a teljesítménykülönbség 48,4 és 73,4 százalék közötti részét zárta le.
- A QAD Q4_0 kisebb és gyorsabb maradt a Q5_K_M formátumnál a közlemény szerint.
- A checkpointok elérhetők a Hugging Face-en.
Négy LFM2.5 modell kapott új checkpointot
A Liquid AI augusztus 19-én jelentette be az LFM2.5-230M, az LFM2.5-350M, az LFM2.5-1.2B-Instruct és az LFM2.5-2.6B frissített, 4 bites változatát. A QAD, vagyis a kvantálástudatos desztilláció során egy nagy pontosságú tanármodellt egy kvantált diákmodellbe desztillálnak.
A vállalat közlése szerint az új checkpointok megtartják a Q4_0 GGUF formátum alacsony memóriaigényét és nagy áteresztőképességét. Közben a kvantálás miatt elvesző pontosság jelentős részét visszanyerik. A négy modell a BF16 alapváltozatok átlagos teljesítményének hozzávetőleg 97 százalékát éri el.
A QAD GGUF fájlok elérhetők a Hugging Face-en az LFM2.5-230M, az LFM2.5-350M, az LFM2.5-1.2B-Instruct és az LFM2.5-2.6B modellhez.
A kisebb modelleknél volt nagyobb a javulás
A Liquid AI a kiadott, utólagos kvantálással készült Q4_0 GGUF változatokat hasonlította össze a betanított QAD Q4_0 checkpointokkal. A tesztek a következtetést, az utasításkövetést, az eszközhasználatot és az ügynöki képességeket vizsgálták. A mérésben a GPQA Diamond, a MMLU-Pro, az IFEval, az IFBench, a Multi-IF és a BFCLv4 szerepelt.
A matematikai teszt a kisebb modelleknél a GSM8K, a nagyobb LFM2.5-1.2B-Instruct és LFM2.5-2.6B esetében pedig az AIME25 volt. Az eredmények öt ismétlés átlagát mutatják.
A QAD az LFM2.5-230M esetében a BF16 és a Q4_0 közötti teljesítménykülönbség 70,6 százalékát zárta le. Az LFM2.5-350M-nél ez az arány 73,4 százalék, az LFM2.5-1.2B-Instructnál 65,5 százalék, az LFM2.5-2.6B-nél pedig 48,4 százalék volt. A modellek rendre a BF16 teljesítmény 97,1, 96,5, 97,4 és 96,6 százalékát érték el.
A Liquid AI szerint a legnagyobb visszanyerés általában a kisebb modelleknél jelentkezett, mivel ezeknél a hagyományos Q4_0 kvantálás arányosan nagyobb minőségvesztést okoz.
Alacsony memóriaigény, nagy sebesség
A vállalat a hét feladat átlagos benchmarkpontszámát a llama.cpp dekódolási sebességével is összevetette. A méréseket másodpercenkénti tokenekben adták meg, négy hardveres háttéren. A tesztelt eszközök között szerepelt egy Apple M5 Max processzorral működő MacBook Pro, egy AMD Ryzen AI Max+ 395 chippel szerelt NucBox EVO-X2, egy Qualcomm Snapdragon 8 Elite Gen 5 processzort használó Samsung Galaxy S26 Ultra, valamint egy Broadcom BCM2712 alapú Raspberry Pi 5.
A QAD Q4_0 checkpointok ugyanazt a natív Q4_0 sebességet használják, mint a kiadott Q4_0 modellek, mivel azonos a GGUF formátumuk, a tenzorelrendezésük és a futtatási útvonaluk. A Liquid AI szerint a Q4_0 natívan a leggyengébb 4 bites formátum minőség szempontjából, ugyanakkor a vizsgált hardvereken ez volt a leggyorsabb.
A QAD Q4_0 az LFM2.5-230M és LFM2.5-350M esetében a futásonkénti eltérésen belül elérte a Q5_K_M minőségét. Az 1.2B modellnél fél ponton belül maradt hozzá képest, miközben kisebb és gyorsabb volt. A vállalat közlése szerint az új változat a Q4_K_M formátumnál is jobb eredményt ért el, és megfelelt az Unsloth UD-Q4_K_XL külső, utólagos kvantálással készült checkpointjának.
Az eredmények alapján a QAD Q4_0 checkpointok azok számára lehetnek relevánsak, akik helyi, korlátozott erőforrású eszközön szeretnének LFM2.5 modellt futtatni, és a Q4_0 sebessége mellett a lehető legtöbb teljesítményt szeretnék megtartani. A fájlok a Liquid AI közleménye szerint már elérhetők a Hugging Face-en.


