
vLLM 0.31.0 发布:717 次提交、307 位贡献者。这一版最值钱的三件事:权重驻留快速重启、DeepSeek-V4.1 优化、新投机解码。
三个值得看的点
1. vllm preload:重启不用重新加载权重
权重跨引擎重启驻留 GPU 内存,用 CRIU 快照恢复。以前每次重启/升级要几分钟甚至十几分钟加载权重,现在秒级。多模型轮转部署的成本直接砍掉一大块。
2. DeepSeek-V4.1-Flash 性能优化 FlashMLA mega attention 成为 SM100 默认路径——在 Blackwell 上跑 DeepSeek 的人直接吃性能红利。
3. Model Runner V2 的 draft-model 投机解码 新的 LiLiCorr drafter,配合大规模 serving(MoonEP、DeepEPv2)和多模态请求安全加固,吞吐和延迟再压一截。
对你的意义
如果你在做本地多模型调度(比如本地 Qwen + 云端模型混跑),preload 的权重驻留把"换模型"这个最慢的环节变成了几乎免费——调度层敢做激进的路由了。
参考
- 发布说明(2026-10-05,二手转述):https://freedom.tech/posts/2026-10-05-vllm-0-31-0/
- 官方仓库:https://github.com/vllm-project/vllm