一张没有视频输出、出厂连风扇都不带的"废卡",核心却是 6800XT——32G 显存,装得下 34B 模型,还能做全参微调。

今天这篇只聊一张卡:AMD Radeon Pro V620。2021 年 AMD 给云桌面 VDI 场景做的数据中心卡,核心规格和 6800XT 完全一样(Navi 21,72CU,512GB/s,FP16 理论算力 40T),但显存给到了 32G。有人把它刷成 6800XT 直接跑 ROCm 6.1.3 + Ollama,实测数据值得看——3090 的 24G 都装不下的 34B 模型,它装得下。

先说结论:

  1. V620 = 6800XT 核心 + 32G 显存,单卡能装 34B Q4 全量,2080Ti 根本装不下
  2. 速度 15-28 tok/s,超过 15 tok/s 的人类阅读速度,日常够用;比 2080Ti 慢 30-60%
  3. 全参微调(llama large / VITS)和 2080Ti 基本打平——8G 消费卡做不了的训练活它做得了
  4. 短板明确:AI 绘图差一截(SDXL 慢 2 倍、Flux 慢 4-6 倍),8bit 量化对 RDNA2 无加速
  5. 闲鱼基本无整卡在售,走 VDI 退役渠道;买前必须问 BIOS、散热、显存健康度三件事

一、环境硬件条件

这张卡是什么:AMD 2021-11 发布的专业卡,定位云游戏 / 云桌面 VDI,一颗卡同时给多个虚拟桌面做渲染。所以它出厂无视频输出、被动散热(靠服务器风道)、BIOS 锁了显示功能。拿到手就是"裸"的,三件改装是硬性成本:

软件环境:Ubuntu 22.04 + ROCm 6.1.3 + PyTorch 2.5 + Ollama(B 站实测同款配置);llama.cpp 支持 HIP 后端,GGUF 模型同样能跑。

对比基准:B 站测试同时放了一张 2080Ti 做对照——显存超过 22G 的模型 2080Ti 没有成绩,这正是 V620 的主场。

二、实测数据

B 站 MarchenAWA 完整实测(2024-10 测试、2025-04-16 发布,Ubuntu 22.04 + ROCm 6.1.3,单源 n=1,待复现;平台:EPYC 7282 + 8 通道 DDR4)。测试流程:先打招呼,再让模型讲 1000 字中文故事,统计短/长输出速度。

LLM 推理(Ollama,12B 以下 FP16,以上 Q4-Q8):

模型 V620 速度 2080Ti 显存占用
Qwen2 7B FP16 24.05 / 21.18 tok/s 31 / 30.15 14.9GB
Llama 3.1 8B FP16 17.93 / 16.80 tok/s 30.83 / 28.43 16.7GB
GLM4 9B FP16 17.57 / 16.07 tok/s 27.48 / 24.31 18.2GB
Mistral 12B q8 27.94 / 24.07 tok/s 35.95 / 31.87 15.1GB
InternLM2 20B q8 18.76 / 16.41 tok/s 装不下 23.1GB
Gemma2 27B q6 15.27 / 13.72 tok/s 装不下 26.6GB
Yi 34B q4 15.17 / 13.82 tok/s 装不下 23.8GB
Command-R 35B q4 16.32 / 15.07 tok/s 装不下 22.5GB

(短内容 / 长内容 两档速度)

训练(和 2080Ti 基本打平):

项目 V620 备注
llama large 全参微调 bs4 FP32 0.09 it/s,显存 29.2GB 30 分钟数据集 100 步约 18 分钟
VITS 训练 bs8 FP32 0.27-0.29 it/s,峰值 8.6GB 半小时数据 3000-5000 步,约 3-5 小时

AI 绘图(ComfyUI 0.2.2,差距最大的一项):

项目 V620 2080Ti
SDXL 1024² 20+5 步 平均 21 秒 10.9 秒(快 2 倍)
Flux.1 dev FP16 1024² 20 步 344 秒(16.45s/it) 55.5 秒(快 4-6 倍)
Flux FP8 速度与 FP16 一致 8bit 量化对 RDNA2 无加速

怎么解读这组数据:

三、踩坑指南(按翻车顺序)

  1. 到手是裸的:无视频输出 + 被动散热,不改装直接上机箱 = 烧卡。解法:先装涡轮(¥48-68)再开机
  2. 出厂 BIOS 锁显示功能:默认 BIOS 下 ROCm 能跑但部分工具识别异常。解法:刷 6800XT 的 BIOS,刷前备份原 BIOS,刷坏只能重刷回去
  3. FP16 推理 triton 版本不兼容降速:fish speech 推理从 110-120 tok/s 掉到 40-85 波动——N 卡上同样存在,是 triton 版本与项目的兼容性问题,不是卡的问题
  4. 8bit 量化对 RDNA2 无加速:Flux FP8 显存降了但速度一点没快,别指望量化补绘图短板,要出图就另配卡
  5. 显存占用超 22G 的模型 2080Ti 对比失效:测试对比时注意这个前提,V620 的 32G 优势只在装得下 24G+ 的模型时才成立

四、避坑指南(买卡之前看)

五、配置清单(照抄)

V620 单卡方案(折腾档):

部件 规格 预算
显卡 V620 32G(刷 6800XT BIOS) 渠道价待核
散热 9CM 涡轮改装件 ¥48-68
电源 650W 起步 —
内存 32GB DDR4 起步(微调时 29G 显存 + 系统占用) —
系统 Ubuntu 22.04 + ROCm 6.1.3 —

能跑什么:12B q8 流畅(27.9 tok/s)/ 20B q8 可用(18.8)/ 34B-35B Q4 全量(15-16)/ llama large 全参微调 / VITS 训练。别指望:SDXL/Flux 绘图(比 2080Ti 慢 2-6 倍)。

怎么选:


数据源:V620 规格为 AMD 官方发布资料(2021-11,32GB GDDR6 / 512GB/s / Infinity Cache);实测数据为 B 站 MarchenAWA 专栏《RADEON PRO V620 AI性能测试》(2024-10 测试,2025-04-16 发布,Ubuntu 22.04 + ROCm 6.1.3 + PyTorch 2.5 + Ollama,EPYC 7282 平台,单源 n=1,待复现);闲鱼 2026-10-10 搜索 20 条无整卡在售(散热改装件 ¥48-68)。