GPT-SoVITS / Fish Speech / Bark / OpenVoice 四款热门开源语音工具分工:零样本开箱用 Fish Speech,1 分钟样本精调音色用 GPT-SoVITS——附显存需求与中文效果对比。
工具分工速查
| 工具 | 定位 | 样本需求 | 显存 | 备注 |
|---|---|---|---|---|
| GPT-SoVITS | 微调级克隆,中文强 | 1 分钟可训练 | 8GB 起 | 中日英韩粤,V2/V4 迭代中 |
| Fish Speech | 零样本多语言 TTS | 给参考音频即用 | 8GB 起 | Fish Audio 开源,长文本稳定 |
| Bark | 零样本 + 音效/笑声 | 零样本 | 8GB 起 | 非中文母语,中文非强项 |
| OpenVoice | 零样本克隆(MIT) | 给参考音频即用 | 8GB 起 | myshell-ai 开源,轻量 |
| Whisper(配套) | ASR 转写(非 TTS) | — | 4GB 起 | 常与上述 TTS 搭配 |
(注:Bark / OpenVoice / Whisper 精确星本次拉取受 GitHub API 限流未取,上表为工具定位与显存事实;星标以仓库实时为准。)
核心分工:'开箱' vs '精调'
| 需求 | 选 | 理由 |
|---|---|---|
| 给一段录音马上克隆,批量出活 | Fish Speech | 零样本免训练,长文本不漂移 |
| 要一个专属音色反复用(播客/虚拟人) | GPT-SoVITS | 1 分钟样本微调,克隆精度天花板 |
| 要带笑声/叹气/音效的'活人感' | Bark | 唯一原生输出非语言声音 |
| 最轻量快速验证 | OpenVoice | 小模型快,MIT 许可宽松 |
| 语音转文字(上游配套) | Whisper / whisper.cpp | 几乎所有 TTS 流水线第一步 |
中文场景提示(社区反馈,推断)
- 中文克隆精度:GPT-SoVITS 中文训练数据充分,中文音色精调首选;Fish Speech 零样本中文开箱即可用,但精调不如 GPT-SoVITS。
- 情绪/韵律:Bark 的非语言声音(笑声、叹气)在中文语境下也偏英文韵律,正式中文内容慎用。
- 长文本:Fish Speech 长文本稳定性四家里最好;GPT-SoVITS 长文本建议分段拼接。
显存与平台
- 8GB 显存(N 卡 / AMD ROCm)四款均可跑;NVIDIA 最顺,AMD 走 ROCm(PyTorch ROCm 环境)。
- CPU 可跑 Bark / OpenVoice(速度慢 10 倍以上,仅适合验证)。
- 训练 GPT-SoVITS 建议 16GB+ 显存,8GB 可用但批次要小。
数据来源:GitHub 公开数据 + 各项目官方 README + 社区整合包反馈(B站/CSDN 2025-2026);定位分工为编辑部综合推断。