# AI 声音工具指南：零样本克隆选 Fish Speech，精调音色选 GPT-SoVITS

> GPT-SoVITS / Fish Speech / Bark / OpenVoice 四款热门开源语音工具分工：零样本开箱用 Fish Speech，1 分钟样本精调音色用 GPT-SoVITS——附显存需求与中文效果对比。

# AI 声音工具指南：零样本克隆选 Fish Speech，精调音色选 GPT-SoVITS

> GPT-SoVITS / Fish Speech / Bark / OpenVoice 四款热门开源语音工具分工：零样本开箱用 Fish Speech，1 分钟样本精调音色用 GPT-SoVITS——附显存需求与中文效果对比。

## 工具分工速查

| 工具 | 定位 | 样本需求 | 显存 | 备注 |
| --- | --- | --- | --- | --- |
| GPT-SoVITS | 微调级克隆，中文强 | 1 分钟可训练 | 8GB 起 | 中日英韩粤，V2/V4 迭代中 |
| Fish Speech | 零样本多语言 TTS | 给参考音频即用 | 8GB 起 | Fish Audio 开源，长文本稳定 |
| Bark | 零样本 + 音效/笑声 | 零样本 | 8GB 起 | 非中文母语，中文非强项 |
| OpenVoice | 零样本克隆（MIT） | 给参考音频即用 | 8GB 起 | myshell-ai 开源，轻量 |
| Whisper（配套） | ASR 转写（非 TTS） | — | 4GB 起 | 常与上述 TTS 搭配 |

*（注：Bark / OpenVoice / Whisper 精确星本次拉取受 GitHub API 限流未取，上表为工具定位与显存事实；星标以仓库实时为准。）*

## 核心分工：'开箱' vs '精调'

| 需求 | 选 | 理由 |
| --- | --- | --- |
| 给一段录音马上克隆，批量出活 | Fish Speech | 零样本免训练，长文本不漂移 |
| 要一个专属音色反复用（播客/虚拟人） | GPT-SoVITS | 1 分钟样本微调，克隆精度天花板 |
| 要带笑声/叹气/音效的'活人感' | Bark | 唯一原生输出非语言声音 |
| 最轻量快速验证 | OpenVoice | 小模型快，MIT 许可宽松 |
| 语音转文字（上游配套） | Whisper / whisper.cpp | 几乎所有 TTS 流水线第一步 |

## 中文场景提示（社区反馈，推断）

1. **中文克隆精度**：GPT-SoVITS 中文训练数据充分，中文音色精调首选；Fish Speech 零样本中文开箱即可用，但精调不如 GPT-SoVITS。
2. **情绪/韵律**：Bark 的非语言声音（笑声、叹气）在中文语境下也偏英文韵律，正式中文内容慎用。
3. **长文本**：Fish Speech 长文本稳定性四家里最好；GPT-SoVITS 长文本建议分段拼接。

## 显存与平台

- 8GB 显存（N 卡 / AMD ROCm）四款均可跑；NVIDIA 最顺，AMD 走 ROCm（PyTorch ROCm 环境）。
- CPU 可跑 Bark / OpenVoice（速度慢 10 倍以上，仅适合验证）。
- 训练 GPT-SoVITS 建议 16GB+ 显存，8GB 可用但批次要小。

*数据来源：GitHub 公开数据 + 各项目官方 README + 社区整合包反馈（B站/CSDN 2025-2026）；定位分工为编辑部综合推断。*


---
来源：https://laobanclaw.top/articles/ai-voice-tools-guide/（AI 军火库）
