Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére

2026. augusztus 24.Forrás: Liquid AI
A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére
Kép: Liquid AI

A Liquid AI és az Artificial Analysis nyílt forráskódú benchmarkrendszert indított az eszközökön futó AI-modellek vizsgálatára. A Pipette a sebességet, késleltetést, memóriahasználatot és a modellminőséget együtt, konkrét telepítési konfigurációk alapján elemzi.

A lényeg röviden
  • A Pipette több mint 1000 modell és eszközkonfiguráció eredményeit tartalmazza.
  • A rendszer a teljesítményt, a memóriahasználatot és a modellminőséget külön, összevethető adatokként kezeli.
  • A kezdeti mérések a MacBook Pro M5 Max, az iPhone 17 Pro és a Galaxy S26 Ultra eszközökre készültek.
  • A benchmarkkliensek macOS, Windows, iOS és Android rendszeren is elérhetők.
  • A Pipette komponensei Apache 2.0 licenc alatt, nyílt forráskóddal jelentek meg.

Több mint ezer konfiguráció eredményei

A Liquid AI augusztus 24-én mutatta be a Pipette nevű platformot, amelynek célja az alapmodellek teljesítményének mérése peremhálózati és mobil eszközökön. A rendszer központi állítása szerint az eszközön futó modell viselkedése a teljes telepített rendszer tulajdonsága, ezért a modellt önmagában vizsgáló eredmények nem írják le minden esetben a valódi használati élményt.

A kiadás része egy nyilvános, laboratóriumban ellenőrzött adatbázis, amely több mint 1000 modell, kvantálás, futtatókörnyezet, eszköz és kontextus kombinációjának eredményeit tartalmazza. Az adatok öt eszközön mért teljesítménymutatót fednek le. A jelenlegi készlet több mint 30 modellt, több kvantálási formátumot, a llama.cpp macOS, iOS, Windows és Android rendszeren használt változatait, valamint 256 és 8192 token közötti kontextushosszakat tartalmaz.

A közzétett kezdeti mérések a MacBook Pro M5 Max, az iPhone 17 Pro és a Galaxy S26 Ultra teljesítményét vizsgálják. Az AMD Ryzen AI Max+ 395 és a Radeon 8060S eredményei a Liquid AI szerint később érkeznek.

A minőség és a hardveres korlátok együtt számítanak

A modellkiadások gyakran szerverosztályú, teljes pontosságú futtatásokból származó képességpontszámokat közölnek. Ezek hasznos viszonyítási alapot adhatnak, de nem feltétlenül jelzik előre, hogyan teljesít ugyanaz a modell egy telefonon vagy laptopon. Az eszközön történő futtatásnál az is meghatározó, hogy a modell elfér-e a memóriában, milyen gyorsan válaszol, és miként működik az adott processzoron.

A Pipette a kvantált modelleket az IFBench, a GPQA Diamond és a MATH-500 feladatain értékeli. Ahol rendelkezésre áll, az FP16 vagy BF16 eredmény szolgál referenciaként. A rendszer így azt is megmutatja, hogy a kvantálás után mennyi marad meg a referenciafuttatásban mért képességekből.

A Liquid AI példája szerint a Galaxy S26 Ultra készüléken, Q4_K_M beállítás mellett a Granite-4.0-H-350M a dekódolási sebességének 78,4 százalékát megőrzi 256-ról 4096 bemeneti tokenre váltva, míg a Granite-4.0-350M esetében ez az arány 33,8 százalék. Egy másik összevetésben az LFM2.5-8B-A1B 2,048 bemeneti tokennél 2,4-szer gyorsabban dekódol, mint a Qwen3.5-4B, és 2,6-szer gyorsabban, mint a Ministral-3B-Instruct-2512. A modell ugyanakkor 5,29 GiB memóriát használ, mivel minden szakértői súly hozzájárul a memóriaigényhez.

Nyílt mérési folyamat és interaktív dashboard

A Pipette teljesítménymérései rögzített tokenformákat, mohó dekódolást, eldobott bemelegítést és öt mért ismétlést használnak. Minden futás előtt a rendszer ellenőrzi a hőmérsékleti és terhelési feltételeket, és csak az ellenőrzésen megfelelt eredményeket teszi közzé. A telefonok energia- és hűtési körülményeit külön módszertani leírás dokumentálja.

A folyamatot három nyílt forráskódú komponens alkotja: a pipette-mgmt kezeli a verziózott benchmarkkatalógust és a beküldéseket, a pipette-clients futtatja a méréseket a célhardveren, a pipette-scores pedig a válaszok értékelését végzi a generálás eredetének ismerete nélkül. Minden beküldés rögzíti többek között a benchmarkot, a tokenformát, a modellkvantálást, a futtatókörnyezetet, a hardvert és az operációs rendszert.

A felhasználók egy eszközönkénti ranglistán, konfigurációs eredménytáblákon és a beküldések böngészőjében vizsgálhatják az adatokat. A dashboard modell, kvantálás, futtatókörnyezet, eszköz, benchmark, kontextushossz és gondolkodási mód szerint szűrhető. A Liquid AI és az Artificial Analysis a teljes infrastruktúrát Apache 2.0 licenc alatt tette közzé, a közösségi eredmények publikálása jelenleg bétaállapotban van.

Kapcsolódó hírek

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5
Fejlesztőknek2026. október 2.

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5

A Baseten állítása szerint a GLM-5 több mint 200 token/másodperces sebességet ért el a szolgáltatásán, miközben az első tokenig eltelt idő körülbelül 200 ezredmásodperc…

A beállítások többet számítanak, mint a helyi LLM-szerverek neve
Kutatás2026. szeptember 17.

A beállítások többet számítanak, mint a helyi LLM-szerverek neve

A Mozilla.ai négy népszerű helyi LLM-szervert hasonlított össze Mac Studio M4-en, NVIDIA L40S-en és Steam Decken. A mérések szerint a teljesítményt sok esetben inkább a…

A Liquid AI DSpark modelljei akár 3,18-szoros gyorsulást ígérnek
Modellek2026. augusztus 20.

A Liquid AI DSpark modelljei akár 3,18-szoros gyorsulást ígérnek

A Liquid AI elérhetővé tette három LFM2.5 modell DSpark változatát, amelyek a vállalat mérései szerint akár 3,18-szoros átviteli sebességet kínálnak GPU-n, és akár…