IndexTTS-2.5是一款由B站IndexSpeech团队于2026年8月开源的零样本语音克隆TTS模型,参数量8亿,主要用于3秒参考音频克隆音色并生成多语种语音,支持中英日西阿5语种、跨语种迁移和4条情感控制路径,推理速度达前代2.28倍,适用于配音、有声书、多语种内容本地化等语音生产场景。
| 基础信息 | 内容 |
|---|---|
| 开发方 | B站(bilibili)IndexSpeech团队 |
| 开源时间 | 2026年8月10日 |
| 参数量 | 0.8B(8亿) |
| 核心能力 | 零样本语音克隆(约3秒参考音频) |
| 支持语种 | 中文、英语、日语、西班牙语、阿拉伯语(5语种)+ 跨语种迁移 |
| 推理速度 | 前代的2.28倍(RTF 0.2065,RTX 4090 bf16) |
| 语速控制 | 0.5×至2.0× |
| 发音控制 | 中文拼音 / 英文CM音标 / 日文假名 |
| 情感控制 | 4条路径:参考音频 / 八维情感向量 / 文本推断 / 情感描述文本 |
| 训练数据 | 约10万小时 |
| 许可证 | Bilibili Model License |
| GitHub Stars | 22.7k |
| 产品定位 | 零样本多语种语音克隆开源TTS |
| 适用人群 | 配音创作者、有声书制作者、多语种内容团队、语音开发者 |

IndexTTS-2.5核心能力与性能
在开源TTS卷到”更大参数”的当下,IndexTTS-2.5反着走:0.8B小模型配上GRPO强化学习训练,在CV3-Eval评测里反超参数量大10倍的Moss-TTS 1.5(8B)。这延续了B站IndexTTS系列”小而准”的技术路线,GitHub仓库已收获22.7k stars。
三段式架构与强化学习
T2S→S2M→声码器的三段流水线是性能与质量的平衡点。第一段T2S(文本转语义)把文字映射到50Hz语义表征,再经语义压缩到25Hz,压缩后序列长度减半、速度翻倍;第二段S2M(语义转梅尔)采用Zipformer结构,官方盲测中56%的听感偏好超过了U-DiT的40%;第三段声码器还原音频。训练上引入GRPO(组相对策略优化)强化学习,用可听度奖励直接优化最终听感,而非只优化中间损失。
零样本克隆与多语种
约3秒参考音频即可克隆音色,5语种可跨语种迁移。比如用一段中文参考音频直接生成日语或西班牙语语音,音色保持不变——这对多语种内容本地化是刚需。发音层面支持中文拼音标注、英文CM音标和日文假名,遇到多音字、专有名词、外语名时可以手动指定读音。
四条情感控制路径
情感表达有四种控制方式按精度递进:直接用带情感的参考音频”带情绪”;八维情感向量精确量化情绪强度;由文本自动推断情感(问句自动带疑问语气);或用自然语言描述情感(”激动地说”)。配合0.5×到2.0×的语速控制,一个模型覆盖了大部分配音表达需求。
CV3-Eval实测:小模型打大模型
以下数据来自官方技术报告的CV3-Eval评测(WER为词错误率越低越好,SIM为音色相似度越高越好):
| 模型 | 参数量 | WER(词错误率) | SIM(音色相似度) |
|---|---|---|---|
| IndexTTS-2.5-RL | 0.8B | 6.00 | 73.63 |
| IndexTTS-2.5 | 0.8B | 6.75 | 73.18 |
| VoxCPM2 | 2B | 7.22 | 72.02 |
| Moss-TTS 1.5 | 8B | 9.40 | 68.56 |
0.8B的IndexTTS-2.5-RL在两项指标上全面领先。对比参数量10倍于它的Moss-TTS 1.5,词错误率低3.4个百分点、音色相似度高5个点。推理速度也快:RTF(实时率)0.2065@RTX 4090,即生成1秒语音只需约0.2秒计算,是前代的2.28倍。
IndexTTS-2.5与主流开源TTS对比
| 对比维度 | IndexTTS-2.5 | CosyVoice 3 | Moss-TTS 1.5 |
|---|---|---|---|
| 开发方 | B站 | 阿里通义 | MiniMax系 |
| 参数量 | 0.8B | 1.5B | 8B |
| WER词错误率 | 6.00(RL版) | 约6-7区间 | 9.40 |
| SIM音色相似度 | 73.63 | 约72区间 | 68.56 |
| 推理速度 | RTF 0.2065@4090 | 中等 | 大参数较慢 |
| 语种 | 中英日西阿5语种 | 多语种 | 中英为主 |
| 许可证 | Bilibili Model License | Apache系 | 各自社区许可 |
开源TTS赛道现在三强并立:站内的CosyVoice Studio和CosyVoice语音合成代表阿里路线,生态成熟、工具链全;IndexTTS-2.5胜在单位参数效率、强化学习带来的自然度和B站社区(22.7k stars);新发布的dots.tts则在中文Seed-TTS-Eval上分数更高。按自己的语种和部署条件选即可。
IndexTTS-2.5应用场景与适用人群
- 有声书与长文本配音:推理快(RTF 0.2)适合批量生成长音频,语速和情感可控保证听感稳定。
- 多语种内容本地化:一个中文音色直接产出英日西阿语音,跨语种迁移省去每语种重新录音。
- 视频配音与角色音色:零样本克隆+情感路径控制,适合需要多角色、多情绪的短视频和动画配音。
- 语音应用开发:开源权重+WebUI(7860端口)+可商用许可(需遵守Bilibili Model License),方便集成到自有产品。
适合谁用:需要高质量中文和多语种TTS的内容创作者、有本地部署需求的语音开发者、想控制成本的有声书团队。注意的情况:商用前需确认Bilibili Model License条款;克隆他人声音需获得授权,声音权益属于人格权范畴,务必合规使用。
如何使用IndexTTS-2.5
- 在线体验:官方和社区提供的WebUI演示可直接试听,上传3秒参考音频即可克隆。
- 本地部署:GitHub克隆仓库,安装依赖后启动WebUI(默认7860端口),RTX 4090上bf16推理RTF约0.2,消费级显卡也能跑。
- API式调用:仓库提供推理脚本,支持指定参考音频、情感向量、语速和拼音标注,方便接入批量生产管线。
- 模型获取:权重托管在Hugging Face和魔搭ModelScope,国内下载ModelScope更快。
IndexTTS-2.5开源许可与已知局限
Bilibili Model License允许商用,但有附加条件。与Apache 2.0这类宽松许可不同,使用前应通读协议原文,确认署名、用途限制等义务;具体条款以官方仓库最新版本为准。
局限:5语种之外的语言(如韩语、法语)暂不支持;0.8B体量在极端复杂情感(哭泣、大笑过渡)上与更大模型仍有差距;参考音频质量直接影响克隆效果,噪音大的素材需先降噪;情感八维向量的调参有一定学习成本,新手建议先用文本推断路径。
常见问题
IndexTTS-2.5本地部署需要什么显卡?
0.8B小模型门槛不高:RTX 4090上bf16推理RTF约0.2(生成1秒音频约0.2秒计算),主流消费级显卡均可运行。权重在Hugging Face和ModelScope都可下载,国内建议用ModelScope。
IndexTTS-2.5可以商用吗?
可以,但需遵守Bilibili Model License。该许可允许商用但有附加条件(如署名要求等),商用部署前请通读官方仓库的最新协议原文,确认自己的使用场景符合条款。
IndexTTS-2.5是免费的吗?
开源免费。本地部署无任何费用,在线体验和社区演示也免费。它是B站IndexSpeech团队2026年8月10日发布的开源项目,GitHub已收获22.7k stars。
IndexTTS-2.5支持哪些语言?
中文、英语、日语、西班牙语、阿拉伯语5个语种,并支持跨语种迁移——用一段中文参考音色直接生成其他语种语音。中文多音字可用拼音标注、英文用CM音标、日文用假名控制发音。
IndexTTS-2.5和CosyVoice、dots.tts怎么选?
都要本地部署开源TTS的话:中文极致自然度看dots.tts(Seed-TTS-Eval中文CER 0.94%);生态成熟度和工具链看CosyVoice系列;追求单位参数效率、推理速度和B站社区活跃度选IndexTTS-2.5。三者均可本地免费使用,建议用自己的素材实测对比。
浙公网安备33010202004812号