跳到主要内容

2025+ 开源语音克隆框架调研:从 IndexTTS、CosyVoice 到 Chatterbox

· 阅读需 17 分钟

过去两年,语音克隆已经从早期的 Bark、Tortoise、VALL-E-X、XTTS-v2 时代,明显切换到“大模型 TTS + zero-shot/few-shot voice cloning”路线。现在主流体验不再只是“能不能模仿音色”,而是看它能不能稳定说长文本、能不能跨语言、能不能控制情绪和语速、能不能本地跑,以及有没有好用的 WebUI 或 Hugging Face demo。

如果是自用场景,许可证不一定是第一过滤条件。更实际的筛选标准是:效果体验、中文/多语能力、上手成本、长文本稳定性、是否适合长期做自己的声音库。 本文按 2025 年以后仍活跃或有新版路线的项目做一次集中梳理。

数据口径

本文的 GitHub Stars、许可证和活跃度快照来自 GitHub API,时间为 2026-08-22。Stars 会持续变化,许可证也可能因“代码许可证”和“模型权重许可证”不同而出现差异;下表优先写出对实际使用影响最大的口径。

先区分两类问题:TTS 克隆和音频换声

“语音克隆”这个词经常混用,但实际至少分两类:

类型输入输出典型项目适合场景
TTS voice cloning文本 + 参考音频用参考音色朗读新文本IndexTTS、CosyVoice、GPT-SoVITS、F5-TTS、Chatterbox配音、播客、个人语音助手、有声读物
Voice conversion原始语音 + 目标音色把已有录音转换成目标音色RVC、Seed-VC翻唱、已有录音换声、歌声转换

本文主要讨论第一类:文字转语音的音色克隆。如果目标是“我已经有一段录音,想把它换成另一个人的声音”,那应该优先看 RVC/Seed-VC,而不是 TTS 克隆模型。

候选项目总览

下面这些项目是本轮更值得优先体验的候选。排序不是绝对质量排名,而是综合了新鲜度、效果体验、中文可用性、Demo/本地上手和社区活跃度。

框架GitHub StarsLicense新鲜度核心能力最适合
GPT-SoVITS61.1kMIT2024 起,持续活跃5 秒 zero-shot、1 分钟 few-shot、WebUI、数据处理链路完整中文/日文/英文少样本克隆,长期做固定声音库
Fish Speech32.3kFish Audio Research License2025+ 活跃多语 TTS、情绪 tag、短参考音频克隆、服务端推理追求表现力、角色化、情绪化声音
Chatterbox26.1kMIT2025+ 活跃多语 V3、Turbo、Nano、paralinguistic tags、内置水印英文/多语 voice agent、自然聊天式 TTS
IndexTTS23.3kbilibili Model Use License2025+ 活跃单条参考音频克隆,情绪/语速/发音控制,中英日西阿中文可控配音、情绪克隆、发音精修
CosyVoice22.8kApache-2.0CosyVoice2/3 路线持续更新多语、方言、情绪、语速/音量指令、流式和部署支持中文/多语综合 TTS、产品化自用服务
Dia19.4kApache-2.02025+英文对话 TTS、音频 prompt、笑声/咳嗽等非语言事件英文播客、角色对话、双人对话感生成
F5-TTS15.1k代码 MIT,权重 CC-BY-NC2025 v1 以后持续活跃Flow Matching TTS,高自然度 zero-shot,Demo 体验好快速体验高自然度音色克隆
Spark-TTS11.0k代码 Apache-2.0,权重常见 CC-BY-NC-SA2025中英双语 zero-shot、voice creation、性别/音高/语速控制中英克隆、虚拟声音创建
OpenVoice37.2kMIT2024 项目,仍有参考价值instant voice cloning、跨语种 tone color cloning、情绪/口音控制快速音色迁移、轻量 baseline

如果严格只保留“2025+ 主线”,OpenVoice 可以放到备选;但它的 MIT 许可证、简单度和历史影响力仍然让它值得作为 baseline 对照。

1. IndexTTS:中文可控性很突出的 zero-shot TTS

IndexTTS 是近两年中文语音克隆里很值得优先测的项目。它的定位不是“只要像”,而是把音色克隆和可控生成结合起来:参考音频负责音色,额外参数负责情绪、发音、语速和语言。

关键能力:

  • 单条参考音频克隆:上传一个 speaker audio prompt,就可以生成目标文本。
  • 多语支持:最新 IndexTTS-2.5 支持中文、英文、日文、西班牙文、阿拉伯文。
  • 情绪控制:可以通过参考音频、情绪描述文本等方式控制语气和表现力。
  • 发音控制:支持中文拼音、英文 CMU phonemes、日文 Kana 等更细粒度的发音修正。
  • 语速控制:通过 duration factor 控制整体说话速度。
  • 部署方向:官方提到 vLLM 生产部署路径,说明它不是只面向 notebook demo。

体验判断:如果你主要测中文个人声音,IndexTTS 应该排在第一梯队。它的优势是“可控”:不是只能靠模型随机发挥,而是能对中文发音、情绪、语速做显式调节。自用时,如果你想做的是“自己的中文配音模型”,它比很多单纯 zero-shot demo 更值得反复调参数。

可能的短板:安装和模型环境比纯在线 demo 更重;同时它采用自定义模型许可证,商用时要读细则。自用不太受影响。

可试入口:

2. CosyVoice:综合能力最均衡的中文/多语方案

CosyVoice 来自 FunAudioLLM 生态,是当前中文和多语 TTS 里非常均衡的一条线。它不只是做“语音克隆”,而是覆盖了训练、推理、Web demo、流式、服务端部署等完整链路。

关键能力:

  • 多语和方言覆盖:CosyVoice 3 路线覆盖中英日韩德西法意俄等常见语言,也强调中文方言/口音。
  • zero-shot / cross-lingual / instruct:可以做零样本克隆、跨语种生成,也能用自然语言指令控制风格。
  • 情绪和语速控制:支持情绪、速度、音量等指令式控制。
  • 流式能力:官方强调双向 streaming,适合低延迟交互场景。
  • 部署友好:支持 vLLM、TensorRT-LLM、FastAPI、Docker 等路径,更接近可长期自用的服务化方案。

体验判断:如果只选一个“综合型”项目,CosyVoice 很可能是最稳的。它不一定在每个 demo 场景都秒杀其他模型,但在中文、多语、方言、服务化和长期维护之间非常平衡。

可能的短板:环境安装、模型下载和部署链路比单个 HF Space 更复杂;不同版本模型的能力差异较大,测试时要明确是 CosyVoice2 还是 Fun-CosyVoice3。

可试入口:

3. GPT-SoVITS:少样本微调生态最成熟

GPT-SoVITS 是中文社区里非常实用的一套语音克隆工具链。它的最大价值不是单点模型,而是“从数据准备到训练/推理”的完整 WebUI 工作流。

关键能力:

  • 5 秒 zero-shot:给一小段参考音频即可尝试克隆。
  • 1 分钟 few-shot 微调:用很少的目标声音数据训练出更稳定的个人音色。
  • WebUI 成熟:提供推理、训练、数据处理等界面。
  • 数据工具齐全:集成伴奏分离、自动切片、多语 ASR、文本处理等环节。
  • 多语支持:覆盖中文、英文、日文、韩文、粤语等常见场景。
  • 推理速度优化:新版本强调 ProPlus 和更快的 RTF 表现。

体验判断:如果你只是想一次性上传 10 秒音频试一下,GPT-SoVITS 不一定是最省事的;但如果你想长期用自己的声音生成内容,GPT-SoVITS 的 few-shot 微调非常关键。很多 zero-shot 模型听起来“像”,但长文本稳定性、口头禅、气息和语速可能不够一致;few-shot 微调往往能解决一部分问题。

可能的短板:链路比纯 zero-shot 复杂,需要准备干净音频、切片、标注或 ASR 校正。要获得好效果,最好愿意花一点时间整理数据。

可试入口:

4. F5-TTS:自然度和在线体验都很好的 quick win

F5-TTS 是 2025 后仍很活跃的高自然度 TTS 路线,官方描述是基于 flow matching 的语音生成模型。它在社区中的吸引力主要来自两个点:自然度好,以及 demo 很容易上手。

关键能力:

  • zero-shot voice cloning:用参考音频和参考文本 prompt 生成目标文本。
  • 高自然度:在很多样例里,声音流畅度、节奏和自然感都比较好。
  • 推理脚本和包化使用:可通过 Python package、CLI、WebUI 等方式使用。
  • 多语言社区微调:Hugging Face 上有不少围绕 F5-TTS 的语言适配和衍生模型。

体验判断:F5-TTS 适合作为“快速看效果上限”的第一批 demo。你准备一段干净参考音频,配好参考文本,通常能较快听出它的自然度优势。

可能的短板:它比较依赖参考音频和对应 transcript 的质量;如果参考文本不准、音频噪声大或语气差异太大,克隆结果会变差。另一个现实问题是,预训练权重常见为非商用许可证;自用可以忽略,但公开产品要谨慎。

可试入口:

5. Chatterbox:英文/多语 voice agent 的强候选

Chatterbox 来自 Resemble AI,定位很接近“自然语音代理”和“多语 voice cloning”。它不是中文生态里最强势的名字,但如果你要做英文、多语或者对话式语音,它非常值得测。

关键能力:

  • 模型族完整:包括 Chatterbox、Chatterbox-Turbo、Chatterbox-Nano、Chatterbox-Multilingual V3。
  • 多语 V3:官方强调 23+ 语言覆盖、更稳定的 speaker similarity、更少 hallucination。
  • 低资源变体:Nano 面向 CPU/端侧,Turbo 面向更快推理。
  • paralinguistic tags:支持类似 [laugh] 的副语言标签,适合聊天和角色声音。
  • 内置水印:生成音频包含 Resemble AI 的 PerTh 水印,体现其 responsible AI 取向。

体验判断:如果你测英文播客、英语 voice agent、跨语言说话风格,Chatterbox 应该放到第一梯队。它的优势不是“中文发音最精细”,而是自然、稳定、适合对话产品。

可能的短板:中文能力要实测,不建议只看英文样例就直接判断它适合所有中文场景。参数如 cfg weight、exaggeration 会影响节奏和表现力,需要调。

可试入口:

6. Fish Speech / OpenAudio:表现力上限高,但更像进阶玩家选项

Fish Speech 是近两年非常活跃的开源 TTS 项目之一。它强调多语、表现力、情绪 tag 和快速克隆,新的 Fish Audio / OpenAudio 路线也在持续推进。

关键能力:

  • 短参考音频克隆:官方文档提到典型 10-30 秒参考样本即可进行快速 voice cloning。
  • 多语能力:面向大量语言和多说话人场景。
  • 情绪 tag:可以在文本里通过标签控制 whisper、excited、angry 等表现。
  • 多轮生成:强调利用上下文提升后续生成自然度。
  • 服务端性能:结合 SGLang 等推理加速方向,适合进阶部署。

体验判断:如果你追求的是“声音有灵魂”、角色感、情绪表达,而不是最简单的一键克隆,Fish Speech 值得测。它的上限可能很高,尤其适合做角色化声音或风格化朗读。

可能的短板:整体生态更偏进阶,版本线、模型权重和部署方式需要仔细选;如果只想点开网页快速玩,体验门槛可能高于 F5-TTS 或 Chatterbox。

可试入口:

7. Spark-TTS:中英双语和 voice creation 很有意思

Spark-TTS 是 2025 年出现的中英双语 TTS/voice cloning 项目。它的一个特色是基于 Qwen2.5 路线,并把 voice cloning 和 voice creation 放在一起。

关键能力:

  • 中英双语:重点覆盖中文和英文,支持跨语言/code-switching 场景。
  • zero-shot voice cloning:无需为目标说话人专门训练即可克隆。
  • voice creation:可通过性别、音高、语速等参数创建虚拟声音。
  • 推理部署:提供 WebUI、CLI 和 Triton 推理服务相关说明。

体验判断:Spark-TTS 适合自用时拿来玩两类东西:一是中英双语克隆,二是创建一个不存在的虚拟声音。如果你不仅想“复制自己的声音”,还想调一个新角色音色,它比纯克隆模型更有趣。

可能的短板:语言覆盖不如 CosyVoice 或 Chatterbox Multilingual;权重许可证常见为非商用,虽然自用无所谓,但公开发布前仍需留意。

可试入口:

8. Dia:不是通用克隆首选,但对话感很强

Dia 来自 Nari Labs,定位更像“超真实对话 TTS”。它可以从 transcript 直接生成对话音频,也能用音频 prompt 控制声音、语气和情绪。

关键能力:

  • 英文对话生成:适合播客、角色对话、两人对话等场景。
  • 音频 prompt:官方建议 5-10 秒参考音频作为 voice cloning/conditioning 输入。
  • 非语言事件:能生成笑声、咳嗽、清嗓等对话中的自然声音。
  • Apache-2.0:许可证友好。

体验判断:Dia 不应被当作“最通用的中文语音克隆工具”。它更适合英文对话、播客样式、角色互动。如果你的目标是做一个英语对话节目或模拟两个人聊天,它很值得加入测试。

可能的短板:官方明确模型只支持英文生成和理解;中文自用场景应优先看 IndexTTS、CosyVoice、GPT-SoVITS。

可试入口:

9. OpenVoice:2024 baseline,仍适合做对照组

OpenVoice V2 不完全符合“2025+”过滤条件,但作为轻量、MIT、跨语种 instant voice cloning baseline,它仍然值得在自用测试里保留一个对照位。

关键能力:

  • instant voice cloning:快速克隆参考音色。
  • 跨语种 tone color cloning:能把音色迁移到不同语言和口音上。
  • 风格控制:支持情绪、口音、节奏、停顿、语调等控制思路。
  • 商业友好许可证:MIT,虽然本文不以许可证为主,但这让它很容易放进工具箱。

体验判断:OpenVoice 的优势是简单、成熟、轻量。它不一定代表 2025+ 最新效果上限,但作为 baseline 很有价值:如果一个新模型比 OpenVoice 复杂很多,效果却没有明显超过它,那就不值得长期维护。

可试入口:

按自用目标选择

如果不想把所有项目都跑一遍,可以按目标缩小范围。

自用目标优先候选原因
中文个人声音克隆,越像越好GPT-SoVITS、IndexTTS、CosyVoiceGPT-SoVITS 适合 few-shot 稳定音色;IndexTTS/CosyVoice zero-shot 和可控性强
快速上传一段音频看效果F5-TTS、IndexTTS、ChatterboxDemo 体验相对直接,容易快速判断音色相似度和自然度
中文情绪配音/角色感IndexTTS、Fish Speech、CosyVoice情绪、语速、发音或 tag 控制更丰富
中英/多语切换CosyVoice、Chatterbox、F5-TTS综合多语能力强,跨语种克隆体验更值得测
长期本地使用GPT-SoVITS、CosyVoice、F5-TTS有本地推理、WebUI、训练或服务化路径
英文播客/对话Chatterbox、Dia对话自然度和副语言事件更适合英文内容
创建一个虚拟声音Spark-TTS、Fish Speech不只克隆,也能调性别、音高、语速或风格

我会怎么排测试顺序

如果测试对象主要是中文自用,我建议按这个顺序:

  1. IndexTTS 2.5:先看中文相似度、情绪控制、语速控制和发音修正能力。
  2. CosyVoice 3/2:看整体稳定性、多语和方言表现,以及是否适合做本地服务。
  3. F5-TTS v1:快速判断自然度上限,尤其是参考音频质量较好时的表现。
  4. GPT-SoVITS:如果 zero-shot 不够像,再投入时间做少样本微调。
  5. Chatterbox V3:补测英文/多语和聊天式 voice agent 场景。
  6. Fish Speech / Spark-TTS:当你想要更强表现力、情绪 tag 或虚拟声音时再测。
  7. Dia:只在英文对话/播客场景需要时测。

测试素材建议

语音克隆模型对素材非常敏感。为了公平比较,建议准备同一套测试集:

  • 参考音频:10-30 秒,干净人声,无 BGM,无明显混响,音量稳定。
  • 参考文本:如果模型需要 transcript,尽量手动校对,标点也要自然。
  • 目标文本:至少包含短句、长句、情绪句和中英混杂句。
  • 输出格式:统一采样率和音量后再听,避免被响度误导。
  • 评估维度:音色相似度、咬字准确率、长文本稳定性、情绪自然度、是否重复/乱续写。

一组简单中文测试文本可以这样设计:

今天我们来聊一下语音克隆模型的实际体验。

这段话稍微长一点,用来测试模型在长文本下会不会断句奇怪、重复,或者出现发音不稳定的问题。

哎,这个效果还真有点意思,比我想象中自然多了。

我今天用的是 voice cloning demo,想测试一下中文、English words,还有一点点情绪变化。

最终结论

如果只从“自用体验”出发,我会把候选压缩成五个主力:

优先级框架一句话结论
1IndexTTS 2.5中文可控性最值得测,情绪、发音、语速都比较完整
2CosyVoice 3/2综合能力最均衡,中文、多语、方言、部署都强
3GPT-SoVITS想长期做自己的声音库,few-shot 微调很实用
4F5-TTS v1快速体验自然度上限,demo 友好
5Chatterbox V3英文/多语 voice agent 和对话式声音值得测

再往后,Fish Speech 适合追求表现力上限,Spark-TTS 适合中英克隆和虚拟声音创建,Dia 适合英文对话,OpenVoice 适合作为轻量 baseline。

真正落地时,不要只听官方样例。最有价值的测试是:用自己的参考音频、自己的目标文本、同一套评估维度,把这些模型各跑一遍。语音克隆的效果差异常常不是“哪个模型绝对最好”,而是“哪个模型最适合你的声音、语言和使用习惯”。