Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A vLLM az AMD GPU-kon vizsgálta a spekulatív dekódolást

2026. augusztus 23.Forrás: vLLM
A vLLM az AMD GPU-kon vizsgálta a spekulatív dekódolást
Kép: vLLM

A vLLM az AMD Instinct MI300X és MI355X GPU-kon vizsgálta a spekulatív dekódolást, amely egyetlen célmodell-futtatásban több előre jelzett tokent is ellenőrizhet. A módszer hatása a tokenenkénti áteresztőképességre a használt modelltől, terheléstől és előrejelzési módszertől függött.

A lényeg röviden
  • A spekulatív dekódolás több jelölt tokent ellenőrizhet egy célmodell-futtatásban.
  • A célmodell marad felelős az elfogadott kimeneti tokenekért.
  • A vLLM öt vázlatkészítési módszert vizsgált.
  • A tesztek AMD Instinct MI300X és MI355X GPU-kon, ROCm mellett zajlottak.
  • A teljesítmény a modelltől, a munkaterheléstől és az elfogadási viselkedéstől is függött.

A célmodell ellenőrzi az előre jelzett tokeneket

A vLLM 2026. augusztus 23-án közzétett bejegyzése szerint a nagy nyelvi modellek kiszolgálásának alapja az autoregresszív dekódolás. Ilyenkor a modell egyszerre egy tokent állít elő, ezt hozzáfűzi a szöveghez, majd a frissített sorozat alapján készíti el a következő tokent. Egy négy tokenből álló kimenet így négy egymást követő dekódolási lépést igényel.

A spekulatív dekódolás ezt a folyamatot egy vázlatkészítő és egy ellenőrző szakaszra bontja. Egy könnyebb vázlatkomponens több jövőbeli tokent javasol, az eredeti modell pedig célmodellként ellenőrzi ezeket. A célmodell marad felelős a végső kimenetért, a vázlatként előállított tokenek önmagukban még nem kerülnek be a válaszba.

Az ellenőrzés balról jobbra történik. A célmodell elfogadja a megfelelő tokeneket, az első elutasítás után pedig a későbbi jelölteket eldobja. Ilyenkor a célmodell saját eredménye adja a folytatást. Ha több javasolt token is átmegy az ellenőrzésen, egyetlen célmodell-futtatásból több kimeneti token kerülhet a szövegbe.

Öt különböző előrejelzési megközelítést vizsgáltak

A bejegyzés öt spekulatív vázlatkészítési módszert ismertet: a native MTP-t, a Gemma 4 MTP-t, az EAGLE-3-at, a DFlash-t és a DSparkot. Ezek abban különböznek, hogy milyen információt kapnak a célmodelltől, hogyan használják fel azt, illetve egymás után vagy párhuzamosan állítják elő a jelölteket.

A módszerek három nagy csoportba sorolhatók. A native MTP modulok közvetlenül a célmodell architektúrájába épülnek, és egymás után generálják a jelölteket. A különálló MTP-vázlatkészítők egy adott célmodellhez párosított ellenőrzőpontot használnak, miközben a célmodell aktivációira és megosztott kulcsérték-gyorsítótárára támaszkodnak.

A célmodellre kondicionált külön hálózatok közé tartozik az EAGLE-3, a DFlash és a DSpark. Az EAGLE-3 autoregresszíven, a célmodell rejtett állapotai alapján készít vázlatot. A DFlash párhuzamos blokkokat állít elő, szintén a célmodell rejtett állapotaiból. A DSpark könnyű oksági korrekciót és bizalomalapú prefixkiválasztást is alkalmaz.

Az eredmények több tényezőtől függtek

A vLLM a vizsgálatokat AMD Instinct MI300X és MI355X GPU-kon, a ROCm nyílt szoftverplatform használatával végezte. A bejegyzés szerint a spekulatív dekódolás kimeneti tokenekre vetített áteresztőképességre gyakorolt hatása változott az alkalmazott vázlatkészítési módszer és a javaslati hossz alapján.

A teljesítményt emellett a modellcsalád, a vázlatkészítő ellenőrzőpontja, a munkaterhelés és az elfogadási viselkedés is befolyásolta. Ez azt jelenti, hogy a módszer használata előtt nem elegendő pusztán a GPU típusát vagy a vázlatkészítő nevét figyelembe venni. A vLLM bejegyzése a működés bemutatása mellett a tesztkörnyezetben való engedélyezést, a hangolást és a megfigyelhetőségi szempontokat is tárgyalja.

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2.

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…