Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

2026. október 2.Forrás: Baseten
A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia
Kép: Baseten

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor Qwen-3.6-35B-A3B modellel, egyetlen NVIDIA B200 gyorsítón futott.

A lényeg röviden
  • A VibeQwen egyetlen NVIDIA B200-on 1792 tokent ért el másodpercenként.
  • A vLLM 943 tokenes eredményéhez képest ez 90 százalékos javulás.
  • Az első tokenig eltelt idő 12 ezredmásodpercre csökkent a 28 ezredmásodperces vLLM-eredményről.
  • 32-es konkurencia mellett a VibeQwen 71 százalékkal nagyobb áteresztőképességet ért el.
  • Az optimalizálás mintegy 1,7 milliárd tokent és 200 B200-órát használt fel.

Egyedi motorral gyorsították fel a Qwen modellt

A Baseten kísérletének kiindulópontja a MetaInfer: A Knowledge Only LLM Inference Engine Generator SKILL Toolbox című tanulmány volt. A kutatás olyan keretrendszert mutat be, amely tudásbázisra, szerződésekre és korlátozásokra támaszkodva képes egyedi inferenciamotorokat létrehozni.

A Baseten a módszert Qwen-3.6-35B-A3B modellel, NVFP4 pontosságú változatban és egyetlen NVIDIA B200 munkaállomáson próbálta ki. Az elkészült motort VibeQwennek nevezték el. A vállalat a vLLM 0.25.1 verziójához hasonlította, amely a kísérlet idején a legújabb változat volt.

A teszt célja az volt, hogy az új motor minden teljesítménymutatóban legalább 20 százalékkal felülmúlja a vLLM-et, miközben nem romlik a pontosság. A Baseten a teljes kiszolgálási réteget vizsgálta, több replikával, terheléselosztó mögött, az AIPerf eszközzel mérve.

A VibeQwen több mérésben is jelentősen gyorsabb lett

A Baseten szerint a VibeQwen minden vizsgált forgalmi mintában felülmúlta a vLLM-et. Egyetlen B200-on, egyfolyamos, ismétlődő és strukturált szövegeknél a VibeQwen másodpercenként 1792 tokent dolgozott fel, szemben a vLLM 943 tokenes eredményével. Ez 90 százalékos javulás.

Az első tokenig eltelt idő, vagyis a TTFT, a tesztelt adathalmazon 12 ezredmásodperc volt a VibeQwen esetében, míg a vLLM-nél 28 ezredmásodperc. A Baseten ezt 2,3-szoros javulásként írja le.

32-es konkurencia mellett, egyetlen replikán a VibeQwen 10 307 kimeneti tokent ért el másodpercenként, a vLLM 6030 tokenes eredményével szemben. Ez 71 százalékos előnyt jelentett.

Az optimalizálást Claude Code végezte

A kísérlethez a Baseten Claude Code-ot használta Fable 5 modellel. Az ügynök hozzáfért a MetaInfer tanulmányához és tárházához, a Qwen NVFP4 formátumú súlyaihoz, valamint a teljes pontosságú súlyokhoz, amelyeket pontossági referenciaként alkalmaztak.

Claude nagyjából egy héten át dolgozott többnyire önállóan. A Baseten munkatársa időnként irányította, hogy az ügynök ne egyetlen forgalmi mintára összpontosítson, és a gyártási teljesítményt vizsgálja az elkülönített motorbenchmarketek helyett.

A folyamat körülbelül 1,7 milliárd tokent használt fel, ezek túlnyomó többsége gyorsítótárazott bemeneti token volt, továbbá mintegy 200 B200-óra kellett hozzá. A motor néhány nap alatt elérte a vLLM szintjét, az ügynököt azonban tovább futtatták.

A Baseten szerint az inferenciamotorok optimalizálása azért alkalmas az automatizálásra, mert a célok számszerűsíthetők. Ilyen mutató a TTFT, a TPOT, az egy gyorsítóra jutó áteresztőképesség és a szükséges memória. A helyesség teljes pontosságú referenciamodellel ellenőrizhető, így a gyorsulás nem feltétlenül jár együtt pontosságvesztéssel.

A specializáció előnye és korlátja

A vLLM, az SGLang és a TensorRT-LLM a Baseten szerint széles modell- és gyorsítóválaszték kiszolgálására készült. Ez az általánosság és az egyszerű használat miatt praktikus, ugyanakkor egyetlen modell, gyorsító és terhelési minta kombinációjára nem feltétlenül optimalizált.

A MetaInfer megközelítése erre a különbségre épít. Egy konkrét telepítéshez készített, erősen specializált motor nagyobb teljesítményt érhet el az általános célú megoldásoknál. A Baseten eredményei alapján ez alacsonyabb késleltetésű alkalmazásokat is lehetővé tehet a Qwen-3.6-35B-A3B modellnél, amelyek korábban nem voltak praktikusak.

A módszer ugyanakkor pontosan meghatározott korlátozásokat igényel. Ha a pontosság megőrzése nincs beépítve a célok közé, az ügynök olyan megoldást is találhat, amely gyors, de használhatatlan. A Baseten ezért változatlan ellenőrzési kapukat és pontossági vizsgálatokat alkalmazott az optimalizálás során.

Kapcsolódó hírek

Fejlesztőknek
Fejlesztőknek2026. október 2.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…