# vLLM 0.31 发布

> 权重驻留快速重启、DeepSeek-V4.1 优化、新投机解码，717 次提交。

![vLLM 0.31 发布](/assets/articles/news/vllm-0-31-release-fast-restart/hero.jpg)

> vLLM 0.31.0 发布：717 次提交、307 位贡献者。这一版最值钱的三件事：权重驻留快速重启、DeepSeek-V4.1 优化、新投机解码。

## 三个值得看的点

**1. `vllm preload`：重启不用重新加载权重**
权重跨引擎重启驻留 GPU 内存，用 CRIU 快照恢复。以前每次重启/升级要几分钟甚至十几分钟加载权重，现在秒级。多模型轮转部署的成本直接砍掉一大块。

**2. DeepSeek-V4.1-Flash 性能优化**
FlashMLA mega attention 成为 SM100 默认路径——在 Blackwell 上跑 DeepSeek 的人直接吃性能红利。

**3. Model Runner V2 的 draft-model 投机解码**
新的 LiLiCorr drafter，配合大规模 serving（MoonEP、DeepEPv2）和多模态请求安全加固，吞吐和延迟再压一截。

## 对你的意义

如果你在做本地多模型调度（比如本地 Qwen + 云端模型混跑），`preload` 的权重驻留把"换模型"这个最慢的环节变成了几乎免费——调度层敢做激进的路由了。

## 参考

- 发布说明（2026-10-05，二手转述）：https://freedom.tech/posts/2026-10-05-vllm-0-31-0/
- 官方仓库：https://github.com/vllm-project/vllm


---
来源：https://laobanclaw.top/articles/vllm-0-31-release-fast-restart/（AI 军火库）
