Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

vllm-metal érkezett az Apple chipes gépek párhuzamos kiszolgálására

2026. szeptember 22.Forrás: vLLM
vllm-metal érkezett az Apple chipes gépek párhuzamos kiszolgálására
Kép: vLLM

A vLLM bejelentette a vllm-metal projektet, amely az Apple Silicon gépekre hozza a vLLM ütemezőjét, lapozott KV-gyorsítótárát és OpenAI-kompatibilis szerverét. A végrehajtást az MLX és a Metal végzi, így több, egy időben érkező modellkérés kiszolgálására is használható.

A lényeg röviden
  • A vllm-metal a vLLM ütemezőjét és OpenAI-kompatibilis szerverét Apple Siliconra hozza.
  • Az MLX és a Metal végzi a modellek végrehajtását.
  • A rendszer lapozott KV-gyorsítótárat és összecsomagolt, változó hosszúságú modelllépéseket használ.
  • A v0.28.0 bevezette az MTP, a GGUF- és a hibridmodell-támogatást.
  • A vLLM szerint a vllm-metal több tesztben alacsony TTFT-t ért el párhuzamos terhelés mellett.

A vLLM rendszere Apple chipeken

A vllm-metal a vLLM felsőbb szintű komponenseire épül. A rendszer a V1 ütemezőt, a lapozott KV-blokkok kezelését, a darabolt előfeldolgozást, a mintavételezést és az OpenAI-kompatibilis, folyamatos válaszadást, valamint eszközhívások elemzését az upstream vLLM-ből veszi át.

A modellmegvalósításokat az mlx_lm biztosítja, a végrehajtásért pedig az MLX felel. A vllm-metal változtatás nélkül használja többek között a súlyok betöltését, az RMSNorm, a lineáris, a MoE- és az MLP-rétegeket. Az attention réteghez saját, lapozott, változó hosszúságú Metal-kernelt használ, mert az attentionnek ismernie kell az egyes kérések határait.

A projekt első hivatalos kiadása a v0.28.0 volt, amelynek verziószámozását a fejlesztők az upstream vLLM-hez igazították. Ez a kiadás bevezette a kötegelt többtokenes előrejelzést, a GGUF- és hibridmodell-támogatást, valamint az M5 gépeken gyorsabb előfeldolgozást.

OpenAI-kompatibilis szerver Homebrew-val

A stabil kiadás macOS 15 vagy újabb rendszert futtató Apple Silicon gépeken telepíthető Homebrew-val. A vLLM közlése szerint a csomagkezelő a Pythont és a függőségeket is kezeli. A szerver a vllm serve paranccsal indítható, a modellek között a Qwen3.5-0.8B, a Qwen3.8-27B-4bit és a Gemma 4 E4B-it példákat említi a dokumentáció.

A szolgáltatás az OpenAI API-t használja, ezért az olyan programok, amelyek OpenAI-kompatibilis alap URL-t támogatnak, a helyi szerverhez irányíthatók. A forrás külön említi a kódoló ügynököket, valamint a Claude Code és a Codex beállítását is.

A következő, v0.29.0 verzió Homebrew-val telepíthető. A forrás szerint a vllm-metal modellmátrixa további támogatott modelleket, a telepítési útmutató pedig más telepítési módokat ismertet.

Lapozott KV-gyorsítótár és kiszámítható memóriahasználat

A vllm-metal memóriaőre a --gpu-memory-utilization kapcsolóval állítható be az inferencia költségkerete, így hely maradhat a macOS és más alkalmazások számára. Induláskor a rendszer bemelegítő futtatást végez, amelybe beleszámítja a modell súlyait, az aktivációkat és az ideiglenes puffereket, majd a fennmaradó keretet rögzített KV-gyorsítótárhoz rendeli.

A rendszer az MLX újrahasznosítható puffer-gyorsítótárát is korlátozza, hogy a memória ne halmozódjon fel a kiszolgálás közben. Ha egy új kérés nem fér el a KV-készletben, várakozik, amíg lapok szabadulnak fel.

A modelllépésben a különböző kérések tokenjeit egyetlen, összecsomagolt tengelyre helyezik. A kérésenkénti határokat a cu_seqlens jelöli, a KV-adatokat pedig fix méretű lapokban, kérésenkénti blokktáblák segítségével tárolják. Ez lehetővé teszi, hogy a már felvett kérések növekedjenek a kitöltött, téglalap alakú gyorsítótár átformálása nélkül.

A fejlesztők szerint terhelés alatt is alacsony marad a TTFT

A vLLM a SiliconBench ügynöki tesztjével mérte a párhuzamos kiszolgálást. A vizsgálat 100 többfordulós promptot használt, körülbelül 4,6 ezer bemeneti tokennel, egy 64 GB memóriájú M5 Pro gépen. A modellek minden összehasonlításban 4 bites súlyokat használtak.

A Qwen3.8-27B esetében a vllm-metal a közlemény szerint 2-es és 4-es konkurenciaszinten érte el a legalacsonyabb első tokenig tartó időt és teljes kéréskésleltetést. A Gemma 4 E4B tesztjét 16-os konkurenciáig bővítették, és az MTP-vázlatmodellt is bevonták. A vllm-metal ebben a vizsgálatban végig alacsony TTFT-t tartott.

A Gemma 4 E4B-nél egy vázlattokennel végzett MTP használata 1-es konkurenciánál 15 százalékkal rövidebb faliórát, 20 százalékkal magasabb kimeneti tokensebességet és 1 százalékkal alacsonyabb átlagos TTFT-t hozott a forrás táblázata szerint. 16-os konkurenciánál ezek az értékek rendre 8 százalékkal alacsonyabb faliórát, 9 százalékkal magasabb tokensebességet és 20 százalékkal magasabb TTFT-t jelentettek.

Az MTP opcionális, a Gemma 4 támogatása jelenleg egyszerű, mohó mintavételezést és szinkron ütemezést igényel. A megoldás így azoknak lehet hasznos, akik Apple Silicon gépen több egyidejű helyi modellkérést, például kódoló ügynökök munkameneteit szeretnék egy OpenAI-kompatibilis végponton kiszolgálni.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2. 23:09

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A vLLM különválasztaná a promptfeldolgozást és a tokenek generálását
Fejlesztőknek2026. szeptember 29.

A vLLM különválasztaná a promptfeldolgozást és a tokenek generálását

A vLLM új útmutatója azt mutatja be, hogyan választható szét a nagy nyelvi modellek kiszolgálásában a promptok feldolgozása, a tokenek generálása és a CPU-s…