vLLM 0.31 发布

vLLM 0.31.0 发布:717 次提交、307 位贡献者。这一版最值钱的三件事:权重驻留快速重启、DeepSeek-V4.1 优化、新投机解码。

三个值得看的点

1. vllm preload:重启不用重新加载权重 权重跨引擎重启驻留 GPU 内存,用 CRIU 快照恢复。以前每次重启/升级要几分钟甚至十几分钟加载权重,现在秒级。多模型轮转部署的成本直接砍掉一大块。

2. DeepSeek-V4.1-Flash 性能优化 FlashMLA mega attention 成为 SM100 默认路径——在 Blackwell 上跑 DeepSeek 的人直接吃性能红利。

3. Model Runner V2 的 draft-model 投机解码 新的 LiLiCorr drafter,配合大规模 serving(MoonEP、DeepEPv2)和多模态请求安全加固,吞吐和延迟再压一截。

对你的意义

如果你在做本地多模型调度(比如本地 Qwen + 云端模型混跑),preload 的权重驻留把"换模型"这个最慢的环节变成了几乎免费——调度层敢做激进的路由了。

参考