A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére

A Liquid AI és az Artificial Analysis nyílt forráskódú benchmarkrendszert indított az eszközökön futó AI-modellek vizsgálatára. A Pipette a sebességet, késleltetést, memóriahasználatot és a modellminőséget együtt, konkrét telepítési konfigurációk alapján elemzi.
- A Pipette több mint 1000 modell és eszközkonfiguráció eredményeit tartalmazza.
- A rendszer a teljesítményt, a memóriahasználatot és a modellminőséget külön, összevethető adatokként kezeli.
- A kezdeti mérések a MacBook Pro M5 Max, az iPhone 17 Pro és a Galaxy S26 Ultra eszközökre készültek.
- A benchmarkkliensek macOS, Windows, iOS és Android rendszeren is elérhetők.
- A Pipette komponensei Apache 2.0 licenc alatt, nyílt forráskóddal jelentek meg.
Több mint ezer konfiguráció eredményei
A Liquid AI augusztus 24-én mutatta be a Pipette nevű platformot, amelynek célja az alapmodellek teljesítményének mérése peremhálózati és mobil eszközökön. A rendszer központi állítása szerint az eszközön futó modell viselkedése a teljes telepített rendszer tulajdonsága, ezért a modellt önmagában vizsgáló eredmények nem írják le minden esetben a valódi használati élményt.
A kiadás része egy nyilvános, laboratóriumban ellenőrzött adatbázis, amely több mint 1000 modell, kvantálás, futtatókörnyezet, eszköz és kontextus kombinációjának eredményeit tartalmazza. Az adatok öt eszközön mért teljesítménymutatót fednek le. A jelenlegi készlet több mint 30 modellt, több kvantálási formátumot, a llama.cpp macOS, iOS, Windows és Android rendszeren használt változatait, valamint 256 és 8192 token közötti kontextushosszakat tartalmaz.
A közzétett kezdeti mérések a MacBook Pro M5 Max, az iPhone 17 Pro és a Galaxy S26 Ultra teljesítményét vizsgálják. Az AMD Ryzen AI Max+ 395 és a Radeon 8060S eredményei a Liquid AI szerint később érkeznek.
A minőség és a hardveres korlátok együtt számítanak
A modellkiadások gyakran szerverosztályú, teljes pontosságú futtatásokból származó képességpontszámokat közölnek. Ezek hasznos viszonyítási alapot adhatnak, de nem feltétlenül jelzik előre, hogyan teljesít ugyanaz a modell egy telefonon vagy laptopon. Az eszközön történő futtatásnál az is meghatározó, hogy a modell elfér-e a memóriában, milyen gyorsan válaszol, és miként működik az adott processzoron.
A Pipette a kvantált modelleket az IFBench, a GPQA Diamond és a MATH-500 feladatain értékeli. Ahol rendelkezésre áll, az FP16 vagy BF16 eredmény szolgál referenciaként. A rendszer így azt is megmutatja, hogy a kvantálás után mennyi marad meg a referenciafuttatásban mért képességekből.
A Liquid AI példája szerint a Galaxy S26 Ultra készüléken, Q4_K_M beállítás mellett a Granite-4.0-H-350M a dekódolási sebességének 78,4 százalékát megőrzi 256-ról 4096 bemeneti tokenre váltva, míg a Granite-4.0-350M esetében ez az arány 33,8 százalék. Egy másik összevetésben az LFM2.5-8B-A1B 2,048 bemeneti tokennél 2,4-szer gyorsabban dekódol, mint a Qwen3.5-4B, és 2,6-szer gyorsabban, mint a Ministral-3B-Instruct-2512. A modell ugyanakkor 5,29 GiB memóriát használ, mivel minden szakértői súly hozzájárul a memóriaigényhez.
Nyílt mérési folyamat és interaktív dashboard
A Pipette teljesítménymérései rögzített tokenformákat, mohó dekódolást, eldobott bemelegítést és öt mért ismétlést használnak. Minden futás előtt a rendszer ellenőrzi a hőmérsékleti és terhelési feltételeket, és csak az ellenőrzésen megfelelt eredményeket teszi közzé. A telefonok energia- és hűtési körülményeit külön módszertani leírás dokumentálja.
A folyamatot három nyílt forráskódú komponens alkotja: a pipette-mgmt kezeli a verziózott benchmarkkatalógust és a beküldéseket, a pipette-clients futtatja a méréseket a célhardveren, a pipette-scores pedig a válaszok értékelését végzi a generálás eredetének ismerete nélkül. Minden beküldés rögzíti többek között a benchmarkot, a tokenformát, a modellkvantálást, a futtatókörnyezetet, a hardvert és az operációs rendszert.
A felhasználók egy eszközönkénti ranglistán, konfigurációs eredménytáblákon és a beküldések böngészőjében vizsgálhatják az adatokat. A dashboard modell, kvantálás, futtatókörnyezet, eszköz, benchmark, kontextushossz és gondolkodási mód szerint szűrhető. A Liquid AI és az Artificial Analysis a teljes infrastruktúrát Apache 2.0 licenc alatt tette közzé, a közösségi eredmények publikálása jelenleg bétaállapotban van.


