8 月 10 日 B 站 IndexSpeech 团队开源了 IndexTTS 2.5,这是一款 0.8B 参数的工业级零样本 TTS。我去 CV3-Eval 评测表里扒了一圈,第一反应是——现在的 TTS 已经不是在比谁参数多了。
它在 5 个语种(中文、英文、日语、西班牙语、阿拉伯语)零样本克隆的横向评测里,把 8B 的 Moss-TTS 1.5 和 22B 的 VoxCPM 都按在了地上。仓库上线 16 天已经攒了 22.7k Star,GitHub Trending 持续挂了好几天。模型权重走的是 Bilibili Model License,ModelScope 和 HuggingFace 双开,论文 arXiv 2601.03888。
观点一:0.8B 在 SS 平均分上反超了 22B
SS(音色相似度)这个指标更接近”听感像不像原声”,WER(词错误率)更接近”听不听得清”。两边分开看:
- WER 平均:IndexTTS 2.5-RL(强化学习版)6.00,5 个对手里最低,比 VoxCPM 22B(7.22)低 1.22 个点
- SS 平均:IndexTTS 2.5-RL 73.63,高于 22B 的 VoxCPM(72.02)和 8B 的 Moss-TTS 1.5(68.56)
这个结果挺反直觉的。22B 模型用了近 28 倍的参数量,被 0.8B 在两个维度同时反超。听起来像是小模型”以小博大”,但更准确的说法是:堆参数这条路线在 TTS 上不像在 LLM 上那么管用。
另外注意,CV3-Eval 评测集在选样上对发音清晰度的覆盖比较均匀,日常听感跟 SS 这个数字的对应关系大概是”听两三个 demo 就能明显感受到差异”。
观点二:跨语种音色迁移才是真正的杀手锏
单一语种的声音克隆已经不稀奇了。Fish Audio S2、CosyVoice 3、Qwen3-TTS 都能做到。IndexTTS 2.5 让我更在意的,反而是它的跨语种音色迁移。
意思是:录入一段中文参考音频(3 秒左右),让模型用这个声纹直接说英文、日文、西班牙文、阿拉伯文。音色保留,语种切换。
<img src="

” alt=”跨语种音色迁移 WER 对比” style=”max-width: 100%; border-radius: 8px; box-shadow: 0 4px 16px rgba(0,0,0,0.1);” />
同样用中文参考音频测跨语种:
- 中文 → 日语:IndexTTS 2.5-RL WER 6.38,Moss-TTS 8B 11.52,VoxCPM 22B 11.84
- 中文 → 阿拉伯语:IndexTTS 2.5-RL 9.89,VoxCPM 22B 11.09,Moss-TTS 8B 17.03
22B 的 VoxCPM 在英语上赢了一点点(4.48 vs 3.55)—— 但在其他三个语种上都输给 IndexTTS。这条指标对中文用户很实际:录自己的声音,就能批量生成多语种配音的播客、有声书旁白、短视频出海版本,不用找多国配音演员。
观点三:参数不是关键,工程细节才是
IndexTTS 2.5 是怎么做到的?我去翻了 README 和论文,挑三个有意思的:
1. 语义 codec 帧率从 50Hz 降到 25Hz。生成阶段的 token 数量直接腰斩,推理开销跟着降。T2S 模块 RTF 从 0.232 降到 0.119,速度翻倍。
2. S2M 模块从 U-DiT 换成 Zipformer。这是语音合成的核心步骤,把语义 token 转成梅尔频谱。在 A10 测试卡上,S2M 模块的 RTF 从 0.078 降到 0.017,又快了 4 倍多。Zipformer 在 ASR 圈子里是老朋友了(kaldi 系),团队把它搬到 TTS 上算是工程上的一个选型胜利。
3. GRPO 强化学习优化听感。用可听度奖励直接优化最终听感,而非中间损失。这是 IndexTTS 2.5 相对 2.0 最大的训练策略变化——也是 RL 版 WER 能再往下打 0.75 个点的关键。
<img src="

” alt=”IndexTTS 2.5 性能对比” style=”max-width: 100%; border-radius: 8px; box-shadow: 0 4px 16px rgba(0,0,0,0.1);” />
三个动作加在一起,没有一项是靠”加大模型”。
本地能不能跑?16GB 的 Mac 算了一下
我自己的主力机是 16GB 统一内存的 Mac,平时跑一个 30B 级本地大模型,已经是充分利用内存了。IndexTTS 2.5 加上声码器,按 bf16 估:
- 0.8B bf16 模型本体 ≈ 1.6GB
- T2S + S2M + 解码器中间态 ≈ 2-3GB
- 留出 8-10GB 给 OS 和主 LLM
理论上 16GB Mac 能跑,但跟那个 30B 模型不能同时在线,要么拿来跑 TTS、要么开 LLM,得二选一。4090 的 RTF 0.21(约 5 倍实时)听起来很快,Mac 上预期要砍半,1 秒音频约 1-2 秒生成——做实时通话不够,做离线有声书足够。
实测要等我自己摸到一台 24GB 的机器才能下结论,这是留给下一轮的 TODO。
如果纯做短文本 TTS、不需要克隆音色,更轻的路线也有:Kokoro(82M,CPU 就能跑)已经能满足多数播报场景;Qwen3-TTS(1.7B)跟 IndexTTS 2.5-WER 接近,生态成熟一些;CosyVoice 3(0.5B / 1.5B)中文调得更细。选 TTS 不能只看榜单,跟模型主流程和你的语言环境强相关。
一句话
TTS 这个赛道正在被卷到一个新维度——参数不再是主战场,工程细节、训练方案、跨语种能力才是分水岭。B 站这次开源的诚意值得点赞,但 Bilibili Model License 不是 Apache 2.0,企业商用前要细看条款。个人玩玩、写写有声书、做做短视频配音,完全够用。
参考资料 | arXiv 2601.03888 | GitHub index-tts/index-tts(22.7k★) | ModelScope / HuggingFace 模型仓库 IndexTeam/IndexTTS-2.5 | 官方 Demo:index-tts2-5.github.io
性能数据来源:CV3-Eval 评测(GitHub README 引用)+ IndexTTS 2.5 官方 README(2026.08.10 更新)
封面图与正文图均为基于公开数据的自制示意图,非官方截图。