A vLLM szerint az ügynöki terhelésekhez új kiszolgálási stratégia kell

Az ügynöki mesterségesintelligencia-terhelések miatt a vLLM a teljes kiszolgálási veremet optimalizálja, a gyorsítótár-kezeléstől a párhuzamosításon át a kérések ütemezéséig. A vállalat szerint az AgentX benchmarkon egyes modelleknél jelentős teljesítmény- és költségelőnyt ért el.
- Az AgentX munkameneteinek mediánja 43 forduló, a bemenet medián hossza 142 ezer token.
- A prefix-gyorsítótár találati aránya meghaladja a 96 százalékot.
- A vLLM akár 130 ezer tokent ért el GPU-másodpercenként DeepSeek V4 Pro modellen.
- MiniMax M3 mellett akár 376 token/másodperc interaktivitást mértek.
- A vLLM 14,6 és 106-szoros közötti költségelőnyt közölt az Opus 5 API-árazásához képest.
Az ügynöki munkafolyamatok különleges terhelést jelentenek
A vLLM szeptember 8-i bejegyzése szerint az ügynöki feladatok egyre nagyobb részt képviselnek a rendszer forgalmában. Ezek a munkafolyamatok többfordulós munkamenetekből, hosszú kontextusokból és gyakori prefix-újrahasznosításból állnak. Emiatt a kiszolgálóknak egyszerre kell mérsékelniük a költséget és a késleltetést.
A SemiAnalysis nyilvános AgentX benchmarkja valós ügynöki kódolási munkamenetekből készített nyomkövetéseket használ. A forrás szerint egy munkamenet mediánja 43 forduló, a bemenet medián hossza 142 ezer token, a kimeneté pedig 444 token. A prefix-gyorsítótár találati aránya meghaladja a 96 százalékot.
A munkamenetek 44 százaléka legalább egy alügynököt is tartalmaz. Ezekben a munkamenetekben az alügynöki futtatások medián száma négy. Az egyes fordulókban a legutóbbi eszközhasználati eredmény hozzáadódik az addigi kontextushoz, majd a teljes kontextust újra elküldik a modellnek. Ezért a bemenet folyamatosan nő, miközben az újonnan feldolgozandó rész rövid marad.
A vLLM három szinten hangolja a rendszert
A vLLM megközelítése három területet fog össze: az adatkezelési, a végrehajtási és a vezérlési síkot. Az adatkezelési sík feladata az elosztott, megosztott KV-gyorsítótár kezelése. A végrehajtási sík a modellhez illeszkedő párhuzamosítási beállításokat és kerneleket választja ki, a vezérlési sík pedig a prefixelőállítás és dekódolás szétválasztásának arányát, valamint a kérések ütemezését koordinálja.
A hosszú kontextusok miatt a KV-gyorsítótár kapacitása különösen fontos. A vLLM hibrid KV-gyorsítótár-kezelője egységes memórialapokat és közös blokkpoolt használ a különböző figyelmi megoldásokhoz. A vállalat szerint ez lehetővé teszi a memória dinamikus újraosztását, miközben a teljes, csúszóablakos és lineáris figyelem eltérő növekedési és élettartam-szabályait is kezeli.
A DeepSeek V4 kezdeti KV-elrendezése három méretkategóriára bontotta a gyorsítótárat, és 92 külön tenzort használt. A vLLM új, csomagolt elrendezése ehelyett blokkonként egy összefüggő háttértárban helyezi el a gyorsítótárcsoportokat és rétegeket. A bejegyzés szerint ez csökkenti a leírók és az adatok átvitelének többletterhét, FP4-indexelő használatakor pedig nagyjából 10 százalékkal mérsékelheti a KV-gyorsítótár memóriaigényét.
Mért eredmények az AgentX benchmarkon
A vLLM az AgentX mérési eredményei alapján a DeepSeek V4 Pro modellen akár 130 ezer teljes tokent ért el GPU-másodpercenként. A MiniMax M3 esetében a rendszer interaktivitása, vagyis a mért tokenenkénti sebesség, akár 376 token másodpercenként volt.
A bejegyzés három modellt vizsgál, a DeepSeek V4 Prot, a MiniMax M3-at és a Kimi K3-at. A vLLM állítása szerint ezeknél a modelleknél a kiszolgálás költségelőnye 14,6 és 106-szoros között alakult az Opus 5 API-árazásához képest. A vállalat az eredményeket a SemiAnalysis AgentX adataira hivatkozva közölte, és a teljesítményt a teljes birtoklási költség egy dollárjára jutó tokenek, valamint a P90 interaktivitás alapján szemléltette.
A vLLM szerint az eredmények azt mutatják, hogy az ügynöki terhelések kiszolgálásánál a gyorsítótár kapacitása, a számítási végrehajtás és a kérések elosztása együtt határozza meg a költség és a késleltetés közötti kompromisszumot. A megfelelő prefixelőállítási és dekódolási arány a munkamenetek, a kontextushosszak, a gyorsítótár-találatok és az egyidejűség változásával szintén módosul.

