2025 年以来大模型 API 价格战越来越猛:多家厂商同周降价、旗舰模型折扣发布、开源模型定价持续下探,公开报道里推理成本的降幅从几十倍到上百倍不等。云上的 AI 越来越便宜,那"花几万块买卡跑本地"这件事还成立吗?
一、价格战的事实面
- 头部厂商 API 价格持续下调,"同能力单位推理成本"一年间下降一个数量级以上
- 开源模型(DeepSeek、Qwen、Llama 系)用 Apache 2.0 这类干净协议持续施压闭源定价
- 30B 级别的本地可跑模型成为新选择——能力覆盖了大量原本必须上云的中等复杂度任务
- 但注意一个区分(有分析指出):单位推理成本在跌,用户感知账单短期未必——因为用量在涨,而且顶级前沿模型仍有溢价
二、本地部署的价值没消失,但边界变了
API 便宜解决了"贵"的问题,但没解决另外几个问题:
- 数据不出门:经营资料、客户数据、内部文档,云端 API 每次调用都在往外发数据。对商家、企业,这是合规红线,不是成本问题
- 稳定性与不可控:API 会限流、会涨价、会下线模型。核心业务依赖外部 API,命脉在别人手里
- 离线与低延迟:内网环境、边缘设备,根本连不上云
- 规模化后的成本反转:调用量足够大时,"电费 + 折旧"和"按 token 付费"的平衡点会向本地倾斜
所以本地部署的核心价值从"省钱"变成了"可控 + 稳定 + 数据主权"。省钱是附加收益,不是主因。
三、什么场景选什么(2026 年的务实版)
- 高频轻量调用 + 数据不敏感:直接用便宜的 API,别折腾硬件
- 数据敏感 + 中高频:本地模型(27B~32B 量化级)是甜点区
- 要最强能力 + 数据不能出门:本地跑量化版旗舰,或私有化部署
- Agent / RAG / 长上下文工作流:本地模型 + 本地向量库,全链路可控,这是最典型的本地场景
四、对做本地部署生意的人
价格战对"卖部署服务"的人不是利空——它把门槛降低了,把需求教育完成了。以前要解释"为什么要本地",现在只需要解释"数据不出门"这一件事。真正稀缺的从"能部署"变成"部署得好":ROCm 这类非 NVIDIA 生态、显存有限制的机器上把模型跑出好速度,才是有付费意愿的细分需求。
结论:云的白菜价改变的是默认选项,改变不了数据主权的需求。先问"数据能不能出门",再算成本账——顺序反了,选型必错。