A vLLM az AMD GPU-kon vizsgálta a spekulatív dekódolást

A vLLM az AMD Instinct MI300X és MI355X GPU-kon vizsgálta a spekulatív dekódolást, amely egyetlen célmodell-futtatásban több előre jelzett tokent is ellenőrizhet. A módszer hatása a tokenenkénti áteresztőképességre a használt modelltől, terheléstől és előrejelzési módszertől függött.
- A spekulatív dekódolás több jelölt tokent ellenőrizhet egy célmodell-futtatásban.
- A célmodell marad felelős az elfogadott kimeneti tokenekért.
- A vLLM öt vázlatkészítési módszert vizsgált.
- A tesztek AMD Instinct MI300X és MI355X GPU-kon, ROCm mellett zajlottak.
- A teljesítmény a modelltől, a munkaterheléstől és az elfogadási viselkedéstől is függött.
A célmodell ellenőrzi az előre jelzett tokeneket
A vLLM 2026. augusztus 23-án közzétett bejegyzése szerint a nagy nyelvi modellek kiszolgálásának alapja az autoregresszív dekódolás. Ilyenkor a modell egyszerre egy tokent állít elő, ezt hozzáfűzi a szöveghez, majd a frissített sorozat alapján készíti el a következő tokent. Egy négy tokenből álló kimenet így négy egymást követő dekódolási lépést igényel.
A spekulatív dekódolás ezt a folyamatot egy vázlatkészítő és egy ellenőrző szakaszra bontja. Egy könnyebb vázlatkomponens több jövőbeli tokent javasol, az eredeti modell pedig célmodellként ellenőrzi ezeket. A célmodell marad felelős a végső kimenetért, a vázlatként előállított tokenek önmagukban még nem kerülnek be a válaszba.
Az ellenőrzés balról jobbra történik. A célmodell elfogadja a megfelelő tokeneket, az első elutasítás után pedig a későbbi jelölteket eldobja. Ilyenkor a célmodell saját eredménye adja a folytatást. Ha több javasolt token is átmegy az ellenőrzésen, egyetlen célmodell-futtatásból több kimeneti token kerülhet a szövegbe.
Öt különböző előrejelzési megközelítést vizsgáltak
A bejegyzés öt spekulatív vázlatkészítési módszert ismertet: a native MTP-t, a Gemma 4 MTP-t, az EAGLE-3-at, a DFlash-t és a DSparkot. Ezek abban különböznek, hogy milyen információt kapnak a célmodelltől, hogyan használják fel azt, illetve egymás után vagy párhuzamosan állítják elő a jelölteket.
A módszerek három nagy csoportba sorolhatók. A native MTP modulok közvetlenül a célmodell architektúrájába épülnek, és egymás után generálják a jelölteket. A különálló MTP-vázlatkészítők egy adott célmodellhez párosított ellenőrzőpontot használnak, miközben a célmodell aktivációira és megosztott kulcsérték-gyorsítótárára támaszkodnak.
A célmodellre kondicionált külön hálózatok közé tartozik az EAGLE-3, a DFlash és a DSpark. Az EAGLE-3 autoregresszíven, a célmodell rejtett állapotai alapján készít vázlatot. A DFlash párhuzamos blokkokat állít elő, szintén a célmodell rejtett állapotaiból. A DSpark könnyű oksági korrekciót és bizalomalapú prefixkiválasztást is alkalmaz.
Az eredmények több tényezőtől függtek
A vLLM a vizsgálatokat AMD Instinct MI300X és MI355X GPU-kon, a ROCm nyílt szoftverplatform használatával végezte. A bejegyzés szerint a spekulatív dekódolás kimeneti tokenekre vetített áteresztőképességre gyakorolt hatása változott az alkalmazott vázlatkészítési módszer és a javaslati hossz alapján.
A teljesítményt emellett a modellcsalád, a vázlatkészítő ellenőrzőpontja, a munkaterhelés és az elfogadási viselkedés is befolyásolta. Ez azt jelenti, hogy a módszer használata előtt nem elegendő pusztán a GPU típusát vagy a vázlatkészítő nevét figyelembe venni. A vLLM bejegyzése a működés bemutatása mellett a tesztkörnyezetben való engedélyezést, a hangolást és a megfigyelhetőségi szempontokat is tárgyalja.


