A Baseten szerint akár 90 százalékkal gyorsabb lett az AI-inferencia

A Baseten egy LLM által létrehozott, egyedi inferenciamotorral akár 90 százalékkal jobb egyfolyamos dekódolási sebességet ért el a vLLM-nél. A VibeQwen nevű motor Qwen-3.6-35B-A3B modellel, egyetlen NVIDIA B200 gyorsítón futott.
- A VibeQwen egyetlen NVIDIA B200-on 1792 tokent ért el másodpercenként.
- A vLLM 943 tokenes eredményéhez képest ez 90 százalékos javulás.
- Az első tokenig eltelt idő 12 ezredmásodpercre csökkent a 28 ezredmásodperces vLLM-eredményről.
- 32-es konkurencia mellett a VibeQwen 71 százalékkal nagyobb áteresztőképességet ért el.
- Az optimalizálás mintegy 1,7 milliárd tokent és 200 B200-órát használt fel.
Egyedi motorral gyorsították fel a Qwen modellt
A Baseten kísérletének kiindulópontja a MetaInfer: A Knowledge Only LLM Inference Engine Generator SKILL Toolbox című tanulmány volt. A kutatás olyan keretrendszert mutat be, amely tudásbázisra, szerződésekre és korlátozásokra támaszkodva képes egyedi inferenciamotorokat létrehozni.
A Baseten a módszert Qwen-3.6-35B-A3B modellel, NVFP4 pontosságú változatban és egyetlen NVIDIA B200 munkaállomáson próbálta ki. Az elkészült motort VibeQwennek nevezték el. A vállalat a vLLM 0.25.1 verziójához hasonlította, amely a kísérlet idején a legújabb változat volt.
A teszt célja az volt, hogy az új motor minden teljesítménymutatóban legalább 20 százalékkal felülmúlja a vLLM-et, miközben nem romlik a pontosság. A Baseten a teljes kiszolgálási réteget vizsgálta, több replikával, terheléselosztó mögött, az AIPerf eszközzel mérve.
A VibeQwen több mérésben is jelentősen gyorsabb lett
A Baseten szerint a VibeQwen minden vizsgált forgalmi mintában felülmúlta a vLLM-et. Egyetlen B200-on, egyfolyamos, ismétlődő és strukturált szövegeknél a VibeQwen másodpercenként 1792 tokent dolgozott fel, szemben a vLLM 943 tokenes eredményével. Ez 90 százalékos javulás.
Az első tokenig eltelt idő, vagyis a TTFT, a tesztelt adathalmazon 12 ezredmásodperc volt a VibeQwen esetében, míg a vLLM-nél 28 ezredmásodperc. A Baseten ezt 2,3-szoros javulásként írja le.
32-es konkurencia mellett, egyetlen replikán a VibeQwen 10 307 kimeneti tokent ért el másodpercenként, a vLLM 6030 tokenes eredményével szemben. Ez 71 százalékos előnyt jelentett.
Az optimalizálást Claude Code végezte
A kísérlethez a Baseten Claude Code-ot használta Fable 5 modellel. Az ügynök hozzáfért a MetaInfer tanulmányához és tárházához, a Qwen NVFP4 formátumú súlyaihoz, valamint a teljes pontosságú súlyokhoz, amelyeket pontossági referenciaként alkalmaztak.
Claude nagyjából egy héten át dolgozott többnyire önállóan. A Baseten munkatársa időnként irányította, hogy az ügynök ne egyetlen forgalmi mintára összpontosítson, és a gyártási teljesítményt vizsgálja az elkülönített motorbenchmarketek helyett.
A folyamat körülbelül 1,7 milliárd tokent használt fel, ezek túlnyomó többsége gyorsítótárazott bemeneti token volt, továbbá mintegy 200 B200-óra kellett hozzá. A motor néhány nap alatt elérte a vLLM szintjét, az ügynököt azonban tovább futtatták.
A Baseten szerint az inferenciamotorok optimalizálása azért alkalmas az automatizálásra, mert a célok számszerűsíthetők. Ilyen mutató a TTFT, a TPOT, az egy gyorsítóra jutó áteresztőképesség és a szükséges memória. A helyesség teljes pontosságú referenciamodellel ellenőrizhető, így a gyorsulás nem feltétlenül jár együtt pontosságvesztéssel.
A specializáció előnye és korlátja
A vLLM, az SGLang és a TensorRT-LLM a Baseten szerint széles modell- és gyorsítóválaszték kiszolgálására készült. Ez az általánosság és az egyszerű használat miatt praktikus, ugyanakkor egyetlen modell, gyorsító és terhelési minta kombinációjára nem feltétlenül optimalizált.
A MetaInfer megközelítése erre a különbségre épít. Egy konkrét telepítéshez készített, erősen specializált motor nagyobb teljesítményt érhet el az általános célú megoldásoknál. A Baseten eredményei alapján ez alacsonyabb késleltetésű alkalmazásokat is lehetővé tehet a Qwen-3.6-35B-A3B modellnél, amelyek korábban nem voltak praktikusak.
A módszer ugyanakkor pontosan meghatározott korlátozásokat igényel. Ha a pontosság megőrzése nincs beépítve a célok közé, az ügynök olyan megoldást is találhat, amely gyors, de használhatatlan. A Baseten ezért változatlan ellenőrzési kapukat és pontossági vizsgálatokat alkalmazott az optimalizálás során.
Baseten: Agentic inference optimization: 50-90% faster engines

