一张没有视频输出、出厂连风扇都不带的"废卡",核心却是 6800XT——32G 显存,装得下 34B 模型,还能做全参微调。

今天这篇只聊一张卡:AMD Radeon Pro V620。2021 年 AMD 给云桌面 VDI 场景做的数据中心卡,核心规格和 6800XT 完全一样(Navi 21,72CU,512GB/s,FP16 理论算力 40T),但显存给到了 32G。有人把它刷成 6800XT 直接跑 ROCm 6.1.3 + Ollama,实测数据值得看——3090 的 24G 都装不下的 34B 模型,它装得下。
先说结论:
- V620 = 6800XT 核心 + 32G 显存,单卡能装 34B Q4 全量,2080Ti 根本装不下
- 速度 15-28 tok/s,超过 15 tok/s 的人类阅读速度,日常够用;比 2080Ti 慢 30-60%
- 全参微调(llama large / VITS)和 2080Ti 基本打平——8G 消费卡做不了的训练活它做得了
- 短板明确:AI 绘图差一截(SDXL 慢 2 倍、Flux 慢 4-6 倍),8bit 量化对 RDNA2 无加速
- 闲鱼基本无整卡在售,走 VDI 退役渠道;买前必须问 BIOS、散热、显存健康度三件事
一、环境硬件条件
这张卡是什么:AMD 2021-11 发布的专业卡,定位云游戏 / 云桌面 VDI,一颗卡同时给多个虚拟桌面做渲染。所以它出厂无视频输出、被动散热(靠服务器风道)、BIOS 锁了显示功能。拿到手就是"裸"的,三件改装是硬性成本:
- 刷 6800XT 的 BIOS(社区有现成流程,刷前备份原 BIOS,刷不回来只能重刷)
- 涡轮散热改装(闲鱼 ¥48-68,9CM 9V 涡轮,适配 V620/MI50/MI100 的通用件)
- 电源:6800XT 功耗档 300W 级,整机 650W 起步
软件环境:Ubuntu 22.04 + ROCm 6.1.3 + PyTorch 2.5 + Ollama(B 站实测同款配置);llama.cpp 支持 HIP 后端,GGUF 模型同样能跑。
对比基准:B 站测试同时放了一张 2080Ti 做对照——显存超过 22G 的模型 2080Ti 没有成绩,这正是 V620 的主场。
二、实测数据
B 站 MarchenAWA 完整实测(2024-10 测试、2025-04-16 发布,Ubuntu 22.04 + ROCm 6.1.3,单源 n=1,待复现;平台:EPYC 7282 + 8 通道 DDR4)。测试流程:先打招呼,再让模型讲 1000 字中文故事,统计短/长输出速度。
LLM 推理(Ollama,12B 以下 FP16,以上 Q4-Q8):
| 模型 | V620 速度 | 2080Ti | 显存占用 |
|---|---|---|---|
| Qwen2 7B FP16 | 24.05 / 21.18 tok/s | 31 / 30.15 | 14.9GB |
| Llama 3.1 8B FP16 | 17.93 / 16.80 tok/s | 30.83 / 28.43 | 16.7GB |
| GLM4 9B FP16 | 17.57 / 16.07 tok/s | 27.48 / 24.31 | 18.2GB |
| Mistral 12B q8 | 27.94 / 24.07 tok/s | 35.95 / 31.87 | 15.1GB |
| InternLM2 20B q8 | 18.76 / 16.41 tok/s | 装不下 | 23.1GB |
| Gemma2 27B q6 | 15.27 / 13.72 tok/s | 装不下 | 26.6GB |
| Yi 34B q4 | 15.17 / 13.82 tok/s | 装不下 | 23.8GB |
| Command-R 35B q4 | 16.32 / 15.07 tok/s | 装不下 | 22.5GB |
(短内容 / 长内容 两档速度)

训练(和 2080Ti 基本打平):
| 项目 | V620 | 备注 |
|---|---|---|
| llama large 全参微调 bs4 FP32 | 0.09 it/s,显存 29.2GB | 30 分钟数据集 100 步约 18 分钟 |
| VITS 训练 bs8 FP32 | 0.27-0.29 it/s,峰值 8.6GB | 半小时数据 3000-5000 步,约 3-5 小时 |
AI 绘图(ComfyUI 0.2.2,差距最大的一项):
| 项目 | V620 | 2080Ti |
|---|---|---|
| SDXL 1024² 20+5 步 | 平均 21 秒 | 10.9 秒(快 2 倍) |
| Flux.1 dev FP16 1024² 20 步 | 344 秒(16.45s/it) | 55.5 秒(快 4-6 倍) |
| Flux FP8 | 速度与 FP16 一致 | 8bit 量化对 RDNA2 无加速 |
怎么解读这组数据:
- LLM 推理是带宽瓶颈,V620 带宽 512GB/s 只比 2080Ti(632GB/s)低 20%,但实际落后 30-60%——连作者本人都觉得意外,RDNA2 的 LLM 路径还没吃到架构红利
- 但 15-28 tok/s 全在人类阅读速度(15 tok/s)之上,日常对话、写文档够用
- 32G 显存是真正的杀手锏:20B/27B/34B/35B 全量模型 2080Ti 装不下、3090 的 24G 也吃紧,V620 宽裕
- 微调能打平 2080Ti,说明它不是只能推理的玩具卡
三、踩坑指南(按翻车顺序)
- 到手是裸的:无视频输出 + 被动散热,不改装直接上机箱 = 烧卡。解法:先装涡轮(¥48-68)再开机
- 出厂 BIOS 锁显示功能:默认 BIOS 下 ROCm 能跑但部分工具识别异常。解法:刷 6800XT 的 BIOS,刷前备份原 BIOS,刷坏只能重刷回去
- FP16 推理 triton 版本不兼容降速:fish speech 推理从 110-120 tok/s 掉到 40-85 波动——N 卡上同样存在,是 triton 版本与项目的兼容性问题,不是卡的问题
- 8bit 量化对 RDNA2 无加速:Flux FP8 显存降了但速度一点没快,别指望量化补绘图短板,要出图就另配卡
- 显存占用超 22G 的模型 2080Ti 对比失效:测试对比时注意这个前提,V620 的 32G 优势只在装得下 24G+ 的模型时才成立
四、避坑指南(买卡之前看)
- 买前问三件事:① 刷没刷过 BIOS(没刷的裸卡自己刷一次)② 散热装没装(没装先装再验收)③ 显存健康度(ROCm 跑一遍 memtest 再收钱)
- 渠道问题:闲鱼本轮 20 条搜索无整卡在售(只有 ¥48-68 的散热改装件),整卡走 VDI 退役 / 数据中心拆机渠道——来路不明的低价优先怀疑坏卡,先谈好"不包好可退"再付款
- 它不是 6800XT 的平替:核心一样但 LLM 慢 30-60%、绘图差 2-6 倍,买它是买 32G 显存 + 微调能力,不是买 6800XT 的性能;要纯性能直接买 6800XT
- 单源数据别当定论:本文全部实测来自一个测试平台(B 站专栏 n=1),不同 ROCm 版本、不同驱动下数字会有出入,下单前按本文环境自己跑一遍 Ollama 基准
- 散热别省:涡轮件 48-68 块,不装就是拿 32G 显存赌温度
五、配置清单(照抄)
V620 单卡方案(折腾档):
| 部件 | 规格 | 预算 |
|---|---|---|
| 显卡 | V620 32G(刷 6800XT BIOS) | 渠道价待核 |
| 散热 | 9CM 涡轮改装件 | ¥48-68 |
| 电源 | 650W 起步 | — |
| 内存 | 32GB DDR4 起步(微调时 29G 显存 + 系统占用) | — |
| 系统 | Ubuntu 22.04 + ROCm 6.1.3 | — |
能跑什么:12B q8 流畅(27.9 tok/s)/ 20B q8 可用(18.8)/ 34B-35B Q4 全量(15-16)/ llama large 全参微调 / VITS 训练。别指望:SDXL/Flux 绘图(比 2080Ti 慢 2-6 倍)。
怎么选:
- 要单卡最大显存 + 想省钱 + 愿意折腾刷 BIOS:V620
- 要 LLM 速度:2080Ti / 3090(V620 慢 30-60%)
- 要出图:消费卡或 N 卡,V620 不碰
- 要省心 + 在保:4060Ti 16G(但显存只有 16G,34B 装不下)
数据源:V620 规格为 AMD 官方发布资料(2021-11,32GB GDDR6 / 512GB/s / Infinity Cache);实测数据为 B 站 MarchenAWA 专栏《RADEON PRO V620 AI性能测试》(2024-10 测试,2025-04-16 发布,Ubuntu 22.04 + ROCm 6.1.3 + PyTorch 2.5 + Ollama,EPYC 7282 平台,单源 n=1,待复现);闲鱼 2026-10-10 搜索 20 条无整卡在售(散热改装件 ¥48-68)。