chatterbox/hero.jpg" alt="Chatterbox 开源 TTS 与情绪控制示意">
订阅了 ElevenLabs 想省钱的先停一下:网上刷屏的"ElevenLabs 开源平替"不是 ElevenLabs 自己,而是 Resemble AI 放出来的 Chatterbox——MIT 协议、26.6k star、号称开源 TTS 的 SOTA。先说清楚一件事:ElevenLabs 是闭源商业公司,它自己没有开源;Chatterbox 是第三方做的本地平替,跑在你自己显卡上。
它是什么
Chatterbox 是 Resemble AI 开源的文本转语音(TTS)模型,基于 0.5B 规模的 LLaMA 架构,用超过 50 万小时精选音频训练。核心卖点三件事:
- 零样本语音克隆:给 5 秒参考音频,就能克隆出这个人的声音
- 情绪强度可控:这是它区别于多数 TTS 的地方——不只是"读出来",而是能调"用什么情绪、多强烈",从平淡陈述到激昂喊话
- 开源免费:MIT 协议,个人和商业都能用,代码和模型权重都公开
GitHub:github.com/resemble-ai/chatterbox(26.6k star / 3.6k fork,2026-07 还在更新)
Turbo 版:为什么它跑得动
真正的惊喜是 Chatterbox Turbo——把原版 0.5B 精简到 350M 参数,关键改动是把"语音令牌 → 梅尔频谱"的解码从 10 步压到 1 步。
这个改动意味着什么:
- 推理速度:单步生成,延迟大幅下降
- 显存占用:比原版低很多,消费级显卡甚至 CPU/MPS 都能跑
- 5 秒克隆:参考音频只需要 5 秒,不用录长样本
换句话说,它把一个"要 A100 才爽"的模型,压成了"你那张 R9700/7900XTX 就能跑"的模型。
和 ElevenLabs 对比
Resemble 用 Podonos 平台做了可复现的盲测,直接拿 Chatterbox Turbo 对线:
- vs ElevenLabs Turbo v2.5
- vs Cartesia Sonic 3
- vs VibeVoice 7B
评测维度是整体偏好、自然度、表现力。社区盲测的普遍结论是 Chatterbox 在自然度上追平甚至超过 ElevenLabs 的部分版本——具体听感因人而异,但"本地能跑出这个水平"这件事本身是实锤。
本地跑起来
git clone https://github.com/resemble-ai/chatterbox
cd chatterbox
pip install -e .官方给了 example_tts.py(标准版)、example_tts_turbo.py(Turbo)、example_tts_nano.py(Nano 轻量版)三个入口,macOS 还有专门的 example_for_mac.py(MPS 支持)。多语言版本需要 opt-in 指定 checkpoint。
一个细节:水印
Chatterbox 生成音频默认带 Perth 隐形水印,可以用 perth + librosa 检测(输出 0.0 无水印 / 1.0 有水印)。做内容分发时留意这条,避免"是不是用 AI 生成的"这个争议。
适合谁
- 不想按字付费用 ElevenLabs 的:跑在本地,零边际成本,不限量
- 要做有声书/配音/短视频旁白的:情绪可控,不用一句一句调
- 要克隆自己/家人声音做个性化内容的:5 秒样本就够
- AMD 用户:PyTorch 后端,ROCm 能跑,不用等 NVIDIA 专属优化
一句话结论
Chatterbox 是当下最接近"ElevenLabs 体验"的开源本地 TTS——MIT 免费、情绪可控、Turbo 版消费级显卡能跑。ElevenLabs 本身没开源,想要本地化的,用它。
参考:GitHub
resemble-ai/chatterbox、Podonos 对比评测页、官方 demopage。