MD 把

AMD 把"让 AI 自己调优 AI 引擎"这件事做出来了——10 月 5 日发布的 ROCm 10.1 主题就叫"打破数据搬运瓶颈",配套 ROCm.AI 里的 Hyperloom 会自动 profile、找瓶颈、改 kernel、再验证,官方口径:同硬件比 ROCm 7 平均 3.3 倍推理提速、2.4 倍训练提速。对 A 卡阵营是结构性动作。

先说结论

一、环境硬件条件

ROCm 10.1 官方支持线:

组件 要求
GPU Instinct 系列 + 消费卡部分型号(R9700 所在 RDNA4 系列在 ROCm 10 支持线内)
CPU AMD 9000 系及以上(官方推荐线)
系统 Linux(官方首发),Windows 经社区移植
内存 64GB 起(MoE 大模型)

本站环境:R9700(32GB GDDR6,640 GB/s)+ i5-9600KF + 32GB——CPU 不在官方支持线内,这正是下一节坑的来源。

二、实测数据

本站尚未完成 ROCm 10.1 全量复测,先给社区口径 + 官方口径分列,本站复测数据出来后会更新本文(标注待更新):

口径 数据 来源
官方 较 ROCm 7 平均 3.3x 推理提速 AMD 官方 newsroom
官方 较 ROCm 7 平均 2.4x 训练提速 AMD 官方 newsroom
社区 R9700 上 MXFP4 fork 路线:MTP 净增益 20.21 → 32.8 t/s(+56%) lcz.me t1529(单次运行)
本站 27B 单流 30 t/s(ROCm 现有版本) 本站实测

三、踩坑指南

  1. 老平台 CPU 不在支持线:i5-9600KF 这类老 CPU 不在 ROCm 10 官方支持列表,走社区移植路线,部分特性(如 Hyperloom 的自动优化)可能不完整。现象:部分算子 fallback CPU,吞吐掉档。
  2. 消费卡支持滞后:消费卡(含 R9700)的上游支持长期靠社区 fork,官方主线优先 Instinct 系列。现象:新特性首发时消费卡要等几周。对策:跟进社区 fork(lcz.me 等),别死等官方。
  3. 升级前备份配置:ROCm 大版本升级后 SGLang/vLLM 社区版需要对应更新,直接原地升级可能起不来。先备份 /opt/rocm 版本记录 + 环境变量。

四、避坑指南

五、配置清单

档位 配置 适合
现役不动 R9700 + 老平台 + ROCm 10.1(社区线) 27B 档单流
升级(推荐) 9950X + X870E(双 PCIe 5.0 x8/x8)+ R9700 27B-70B 单流,撑到 2028
激进 同上 + 第二张 R9700 70B 档,等 ROCm 多卡 P2P 稳定

数据源:AMD 官方 newsroom(ROCm 10 / ROCm.AI)、ROCm 官方发布历史页(10.1.0 = 2026-10-05)、lcz.me t1529(社区实测,单次运行)、本站实测。