# Ollama + ROCm：AMD 显卡从零跑通本地大模型

> AMD 显卡用户跑本地模型的完整路径：ROCm 环境准备、ollama-for-amd 部署、模型运行验证与常见坑，附 R9700 实测。

AMD 显卡跑本地大模型，过去最大的问题是"生态不友好"。随着 ROCm 平台持续完善、ollama-for-amd 这类项目的成熟，游戏卡/专业卡转 AI 推理的路径已经非常顺了。这篇把从零到跑通的全过程写清楚。

## 一、前置条件

- Linux 系统（Ubuntu 22.04+ / 24.04 均可），AMD 显卡 + 最新 AMD 官方驱动
- 显存决定你能跑多大的模型：16GB 显存跑 14B 量化模型，32GB 显存可以跑 27B 的 Q4 量化
- 先验证驱动：`amdgpu-info` 能看到显卡且驱动版本较新，是后面一切的前提

## 二、部署 Ollama（ROCm 版）

官方 Ollama 对 AMD 的支持依赖 ROCm，版本对应关系容易踩坑。推荐直接用 **ollama-for-amd** 方案：它把 ROCm 依赖打包好，解决兼容性和性能问题，一条命令装完。

关键步骤：

1. 安装对应 ROCm 版本的 Ollama
2. 启动服务，确认日志里识别到了 GPU（而不是 fallback 到 CPU）
3. `ollama run qwen3:27b` 拉取并运行模型
4. 用 `rocm-smi` 或 `amd-smi` 看 GPU 利用率——推理时显存和算力占用上来了，才算真正跑在卡上

## 三、R9700 / RX 7000 系列实测要点

以 Radeon AI PRO R9700（32GB GDDR6）为例：

- 27B Q4 量化模型可以完整载入显存，推理全程 GPU 处理
- 注意功耗和散热：负载下功耗上得很高，长期跑建议检查散热
- 驱动版本要和 ROCm 版本匹配，"驱动新 + ROCm 旧"是玄学问题的高发区

## 四、常见坑

1. **GPU 没被识别**：多半是 ROCm 版本和显卡架构不匹配，查 ollama-for-amd 的兼容列表
2. **跑着跑着掉回 CPU**：检查显存是否不够，模型没装下
3. **速度慢得离谱**：确认 SDMA 设置（HSA_ENABLE_SDMA=0 在某些配置下反而快）
4. **容器/虚拟化环境**：ROCm 在容器里的 GPU 直通比 NVIDIA 的 nvidia-container-toolkit 折腾得多，物理机最省心

## 五、跑起来之后

- 接 Open WebUI 就有完整的聊天界面
- 对外暴露 OpenAI 兼容 API，任何支持 OpenAI 格式的工具（Cursor、Dify、各类 Agent 框架）都能直接连
- 多模型切换：Ollama 同时挂多个模型，按需 `ollama run`

跑通之后，你就有了完全可控、不依赖云端的本地推理能力。下一步可以看我们另一篇显存不够时的量化策略文章。

---
来源：https://laobanclaw.top/articles/ollama-rocm-amd-setup/（AI 军火库）
