Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A vLLM Tenstorrent-támogatást kapott, a GPU-któl eltérő működéssel

2026. szeptember 7.Forrás: vLLM
A vLLM Tenstorrent-támogatást kapott, a GPU-któl eltérő működéssel
Kép: vLLM

A vLLM új pluginje Tenstorrent gyorsítókat kapcsol be a nagy nyelvi modellek kiszolgálásába. A fejlesztés megtartja a vLLM OpenAI-kompatibilis felületét, miközben a Tenstorrent mesh architektúrájához külön ütemezőt és futtatási logikát használ.

A lényeg röviden
  • A vLLM TT Plugin Tenstorrent gyorsítókat tesz elérhetővé a vLLM számára.
  • A használat közben megmarad az OpenAI-kompatibilis API és a meglévő klienskód.
  • Llama, Qwen, Mistral, Gemma, DeepSeek V3 és GPT-OSS modellek is támogatottak.
  • A Tenstorrent mesh miatt a plugin külön, fázisokra bontott ütemezőt használ.
  • A modellimplementációk a TT-Metalben, nem magában a pluginban találhatók.

Külön plugin, változatlan kliensoldali felület

A vLLM szeptember 7-én bemutatta a vLLM TT Plugint, amely a Tenstorrent gyorsítóit a vLLM szabványos, külső platformplugin-mechanizmusán keresztül támogatja. A plugin a vLLM mellett telepíthető, és ha a TT-Metal részeként érkező ttnn importálható, automatikusan felismeri és vLLM-platformként regisztrálja a Tenstorrent hardvert.

A kiszolgálási felület közben változatlan marad. Ugyanaz az OpenAI-kompatibilis API, ugyanaz a kérésformátum és ugyanaz a klienskód használható, mint a vLLM más platformjain. A vLLM szerint a fejlesztés fontos része, hogy a Tenstorrent működésének sajátosságait a vLLM magjának módosítása nélkül lehetett megvalósítani.

Több Llama, Qwen és más modellcsalád is támogatott

A plugin a Tenstorrenthez tartozó modellarchitektúrákat TT előtaggal regisztrálja. A rendszer az ellenőrzőpontban deklarált architektúra alapján választ, nem pusztán a modell neve alapján. A támogatott családok között szerepel a Llama 3.1, 3.2 és 3.3, a Llama 3.2 Vision, a Qwen 2.5, Qwen 3, Qwen 3.5 és Qwen 3.6, továbbá a Qwen 2.5-VL és Qwen 3-VL.

A felsorolásban megtalálható a Mistral és a Mistral 3, a Gemma 3 és Gemma 4, a DeepSeek V3, valamint a GPT-OSS 20B és 120B is. A multimodális modellek közül a vLLM közlése szerint a Llama 3.2 Vision, a Qwen-VL, a Qwen 3.6, a Mistral 3 és a Gemma 3 is futtatható a pluginnal.

A modellimplementációk a TT-Metalben találhatók. A plugin a neveket regisztrálja, míg a hozzájuk tartozó, kézzel írt TTNN-megvalósításokat a TT-Metal biztosítja. Egy architektúra több modellkiadást is lefedhet, például a TTQwen3_5ForConditionalGeneration szolgálja ki a Qwen/Qwen3.6-27B modellt.

A Tenstorrent mesh miatt másképp működik az ütemezés

A vLLM TT Plugin a Tenstorrent rendszerét nem hagyományos GPU-ként kezeli. A Tenstorrent rendszer magokból és chipekből álló mesh, amelyben az adatokat chipközi hálózat továbbítja. Az n150 és n300 kártyák is kisebb meshnek számítanak, a QuietBox nagyobb rendszert alkot, a Galaxy pedig 32 Wormhole chipből áll. A futtatási környezet a FABRIC_1D, FABRIC_2D és FABRIC_1D_RING topológiákat is konfigurálhatja.

A modelleket a teljes mesh alakjára fordítják és követik le. Emiatt a párhuzamosítás nem futás közben beállított tensor- vagy pipeline-párhuzamos rangokkal történik. A plugin dokumentációja szerint a MESH_DEVICE=TG váltja ki a --tensor-parallel-size használatát, a -tp és -pp paramétereket pedig elutasítja.

A vLLM szerint a futtatás alapegysége egy teljes, követett lépés. A rögzített kötegmérethez igazított végrehajtás miatt a homogén, stabil alakú kötegek olcsóbban futtathatók, mint a különböző alakúak. A mintavételezés akár az eszközön is történhet, így a token kiválasztása után a gazdagépnek nem feltétlenül kell megkapnia a logiteket.

Fázisokra bontott ütemező a stabil kötegekért

A Tenstorrenthez készült útvonalon minden ütemezési lépés háromféle lehet: csak előfeldolgozás, csak dekódolás vagy üres. Előfeldolgozási és dekódolási feladatokat ugyanabba a kötegbe nem kever. A hosszú promptok darabolt előfeldolgozással több lépésben is feldolgozhatók, miközben a dekódolási lépések ezek között haladnak tovább.

A vLLM közlése szerint alapértelmezésben az előfeldolgozási munka élvez elsőbbséget. Ha új előfeldolgozás nem fér be, a futó kérések dekódolása külön lépésben folytatódik, ami enyhítheti a KV-gyorsítótár terhelését. Ez az ütemezési modell a rögzített végrehajtási nyomokhoz igazodik, és a plugin célja szerint a Tenstorrent mesh sajátosságait a vLLM magjának forkolása nélkül kezeli.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Fejlesztőknek2026. október 2. 23:09

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor…

Fejlesztőknek
Fejlesztőknek2026. október 2. 21:55

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…