AMD 显卡跑本地大模型,过去最大的问题是"生态不友好"。随着 ROCm 平台持续完善、ollama-for-amd 这类项目的成熟,游戏卡/专业卡转 AI 推理的路径已经非常顺了。这篇把从零到跑通的全过程写清楚。
一、前置条件
- Linux 系统(Ubuntu 22.04+ / 24.04 均可),AMD 显卡 + 最新 AMD 官方驱动
- 显存决定你能跑多大的模型:16GB 显存跑 14B 量化模型,32GB 显存可以跑 27B 的 Q4 量化
- 先验证驱动:
amdgpu-info能看到显卡且驱动版本较新,是后面一切的前提
二、部署 Ollama(ROCm 版)
官方 Ollama 对 AMD 的支持依赖 ROCm,版本对应关系容易踩坑。推荐直接用 ollama-for-amd 方案:它把 ROCm 依赖打包好,解决兼容性和性能问题,一条命令装完。
关键步骤:
- 安装对应 ROCm 版本的 Ollama
- 启动服务,确认日志里识别到了 GPU(而不是 fallback 到 CPU)
ollama run qwen3:27b拉取并运行模型- 用
rocm-smi或amd-smi看 GPU 利用率——推理时显存和算力占用上来了,才算真正跑在卡上
三、R9700 / RX 7000 系列实测要点
以 Radeon AI PRO R9700(32GB GDDR6)为例:
- 27B Q4 量化模型可以完整载入显存,推理全程 GPU 处理
- 注意功耗和散热:负载下功耗上得很高,长期跑建议检查散热
- 驱动版本要和 ROCm 版本匹配,"驱动新 + ROCm 旧"是玄学问题的高发区
四、常见坑
- GPU 没被识别:多半是 ROCm 版本和显卡架构不匹配,查 ollama-for-amd 的兼容列表
- 跑着跑着掉回 CPU:检查显存是否不够,模型没装下
- 速度慢得离谱:确认 SDMA 设置(HSA_ENABLE_SDMA=0 在某些配置下反而快)
- 容器/虚拟化环境:ROCm 在容器里的 GPU 直通比 NVIDIA 的 nvidia-container-toolkit 折腾得多,物理机最省心
五、跑起来之后
- 接 Open WebUI 就有完整的聊天界面
- 对外暴露 OpenAI 兼容 API,任何支持 OpenAI 格式的工具(Cursor、Dify、各类 Agent 框架)都能直接连
- 多模型切换:Ollama 同时挂多个模型,按需
ollama run
跑通之后,你就有了完全可控、不依赖云端的本地推理能力。下一步可以看我们另一篇显存不够时的量化策略文章。