AMD 显卡跑本地大模型,过去最大的问题是"生态不友好"。随着 ROCm 平台持续完善、ollama-for-amd 这类项目的成熟,游戏卡/专业卡转 AI 推理的路径已经非常顺了。这篇把从零到跑通的全过程写清楚。

一、前置条件

二、部署 Ollama(ROCm 版)

官方 Ollama 对 AMD 的支持依赖 ROCm,版本对应关系容易踩坑。推荐直接用 ollama-for-amd 方案:它把 ROCm 依赖打包好,解决兼容性和性能问题,一条命令装完。

关键步骤:

  1. 安装对应 ROCm 版本的 Ollama
  2. 启动服务,确认日志里识别到了 GPU(而不是 fallback 到 CPU)
  3. ollama run qwen3:27b 拉取并运行模型
  4. 用 rocm-smi 或 amd-smi 看 GPU 利用率——推理时显存和算力占用上来了,才算真正跑在卡上

三、R9700 / RX 7000 系列实测要点

以 Radeon AI PRO R9700(32GB GDDR6)为例:

四、常见坑

  1. GPU 没被识别:多半是 ROCm 版本和显卡架构不匹配,查 ollama-for-amd 的兼容列表
  2. 跑着跑着掉回 CPU:检查显存是否不够,模型没装下
  3. 速度慢得离谱:确认 SDMA 设置(HSA_ENABLE_SDMA=0 在某些配置下反而快)
  4. 容器/虚拟化环境:ROCm 在容器里的 GPU 直通比 NVIDIA 的 nvidia-container-toolkit 折腾得多,物理机最省心

五、跑起来之后

跑通之后,你就有了完全可控、不依赖云端的本地推理能力。下一步可以看我们另一篇显存不够时的量化策略文章。