LMDeploy 是清华系 InternLM 团队推出的"全家桶"式 LLM 推理框架,架构核心是 TurboMind 双引擎:一个 C++/CUDA 的高性能引擎负责计算图融合与内存池管理,另一个 PyTorch 兼容引擎负责调试友好,二者可按需切换。它内置完整工具链——从模型量化压缩(支持 INT4、INT8、FP16 等多种精度)到服务部署(RESTful API、gRPC 接口),再到性能监控与调试,一套框架跑完全流程,无需在多个工具之间来回切换。在 128 并发吞吐测试中 LMDeploy 可达约 420 tokens/s,明显领先 vLLM 的约 230 tokens/s。它还深度适配国产 GPU(如昇腾),支持多模态(文本、图像、视频),是国产化算力环境部署的首选。
大模型部署
LMDeploy (InternLM)
TurboMind 双引擎 + 量化 + 服务全家桶,国产算力(昇腾)首选
免费开源支持中文