Inferact

Ötszörös agentikus áteresztést ért el a vLLM a DeepSeek-V4.1-Flash-sel
A vLLM és az Inferact optimalizációival akár 5,3-szoros áteresztést értek el a DeepSeek-V4.1-Flash esetében egy 150 TPS-es korláton. Alacsony konkurenciánál a modell…

A vLLM már az első napon támogatja a 2,4 billió paraméteres Qwen3.8-at
A vLLM már a megjelenés napjától futtatja a Qwen3.8-2.4T-A95B modellt, amely a Qwen család első nyílt súlyú, Qwen-Max kategóriájú modellje. A 2,4 billió paraméteres…