A vLLM Tenstorrent-támogatást kapott, a GPU-któl eltérő működéssel

A vLLM új pluginje Tenstorrent gyorsítókat kapcsol be a nagy nyelvi modellek kiszolgálásába. A fejlesztés megtartja a vLLM OpenAI-kompatibilis felületét, miközben a Tenstorrent mesh architektúrájához külön ütemezőt és futtatási logikát használ.
- A vLLM TT Plugin Tenstorrent gyorsítókat tesz elérhetővé a vLLM számára.
- A használat közben megmarad az OpenAI-kompatibilis API és a meglévő klienskód.
- Llama, Qwen, Mistral, Gemma, DeepSeek V3 és GPT-OSS modellek is támogatottak.
- A Tenstorrent mesh miatt a plugin külön, fázisokra bontott ütemezőt használ.
- A modellimplementációk a TT-Metalben, nem magában a pluginban találhatók.
Külön plugin, változatlan kliensoldali felület
A vLLM szeptember 7-én bemutatta a vLLM TT Plugint, amely a Tenstorrent gyorsítóit a vLLM szabványos, külső platformplugin-mechanizmusán keresztül támogatja. A plugin a vLLM mellett telepíthető, és ha a TT-Metal részeként érkező ttnn importálható, automatikusan felismeri és vLLM-platformként regisztrálja a Tenstorrent hardvert.
A kiszolgálási felület közben változatlan marad. Ugyanaz az OpenAI-kompatibilis API, ugyanaz a kérésformátum és ugyanaz a klienskód használható, mint a vLLM más platformjain. A vLLM szerint a fejlesztés fontos része, hogy a Tenstorrent működésének sajátosságait a vLLM magjának módosítása nélkül lehetett megvalósítani.
Több Llama, Qwen és más modellcsalád is támogatott
A plugin a Tenstorrenthez tartozó modellarchitektúrákat TT előtaggal regisztrálja. A rendszer az ellenőrzőpontban deklarált architektúra alapján választ, nem pusztán a modell neve alapján. A támogatott családok között szerepel a Llama 3.1, 3.2 és 3.3, a Llama 3.2 Vision, a Qwen 2.5, Qwen 3, Qwen 3.5 és Qwen 3.6, továbbá a Qwen 2.5-VL és Qwen 3-VL.
A felsorolásban megtalálható a Mistral és a Mistral 3, a Gemma 3 és Gemma 4, a DeepSeek V3, valamint a GPT-OSS 20B és 120B is. A multimodális modellek közül a vLLM közlése szerint a Llama 3.2 Vision, a Qwen-VL, a Qwen 3.6, a Mistral 3 és a Gemma 3 is futtatható a pluginnal.
A modellimplementációk a TT-Metalben találhatók. A plugin a neveket regisztrálja, míg a hozzájuk tartozó, kézzel írt TTNN-megvalósításokat a TT-Metal biztosítja. Egy architektúra több modellkiadást is lefedhet, például a TTQwen3_5ForConditionalGeneration szolgálja ki a Qwen/Qwen3.6-27B modellt.
A Tenstorrent mesh miatt másképp működik az ütemezés
A vLLM TT Plugin a Tenstorrent rendszerét nem hagyományos GPU-ként kezeli. A Tenstorrent rendszer magokból és chipekből álló mesh, amelyben az adatokat chipközi hálózat továbbítja. Az n150 és n300 kártyák is kisebb meshnek számítanak, a QuietBox nagyobb rendszert alkot, a Galaxy pedig 32 Wormhole chipből áll. A futtatási környezet a FABRIC_1D, FABRIC_2D és FABRIC_1D_RING topológiákat is konfigurálhatja.
A modelleket a teljes mesh alakjára fordítják és követik le. Emiatt a párhuzamosítás nem futás közben beállított tensor- vagy pipeline-párhuzamos rangokkal történik. A plugin dokumentációja szerint a MESH_DEVICE=TG váltja ki a --tensor-parallel-size használatát, a -tp és -pp paramétereket pedig elutasítja.
A vLLM szerint a futtatás alapegysége egy teljes, követett lépés. A rögzített kötegmérethez igazított végrehajtás miatt a homogén, stabil alakú kötegek olcsóbban futtathatók, mint a különböző alakúak. A mintavételezés akár az eszközön is történhet, így a token kiválasztása után a gazdagépnek nem feltétlenül kell megkapnia a logiteket.
Fázisokra bontott ütemező a stabil kötegekért
A Tenstorrenthez készült útvonalon minden ütemezési lépés háromféle lehet: csak előfeldolgozás, csak dekódolás vagy üres. Előfeldolgozási és dekódolási feladatokat ugyanabba a kötegbe nem kever. A hosszú promptok darabolt előfeldolgozással több lépésben is feldolgozhatók, miközben a dekódolási lépések ezek között haladnak tovább.
A vLLM közlése szerint alapértelmezésben az előfeldolgozási munka élvez elsőbbséget. Ha új előfeldolgozás nem fér be, a futó kérések dekódolása külön lépésben folytatódik, ami enyhítheti a KV-gyorsítótár terhelését. Ez az ütemezési modell a rögzített végrehajtási nyomokhoz igazodik, és a plugin célja szerint a Tenstorrent mesh sajátosságait a vLLM magjának forkolása nélkül kezeli.

