2025+ 开源语音克隆框架调研:从 IndexTTS、CosyVoice 到 Chatterbox
过去两年,语音克隆已经从早期的 Bark、Tortoise、VALL-E-X、XTTS-v2 时代,明显切换到“大模型 TTS + zero-shot/few-shot voice cloning”路线。现在主流体验不再只是“能不能模仿音色”,而是看它能不能稳定说长文本、能不能跨语言、能不能控制情绪和语速、能不能本地跑,以及有没有好用的 WebUI 或 Hugging Face demo。
如果是自用场景,许可证不一定是第一过滤条件。更实际的筛选标准是:效果体验、中文/多语能力、上手成本、长文本稳定性、是否适合长期做自己的声音库。 本文按 2025 年以后仍活跃或有新版路线的项目做一次集中梳理。