IndexTTS-2.5 – B站开源的零样本多语种语音克隆TTS

IndexTTS-2.5是一款由B站IndexSpeech团队于2026年8月开源的零样本语音克隆TTS模型,参数量8亿,主要用于3秒参考音频克隆音色并生成多语种语音,支持中英日西阿5语种、跨语种迁移和4条情感控制路径,推理速度达前代2.28倍,适用于配音、有声书、多语种内容本地化等语音生产场景。

基础信息内容
开发方B站(bilibili)IndexSpeech团队
开源时间2026年8月10日
参数量0.8B(8亿)
核心能力零样本语音克隆(约3秒参考音频)
支持语种中文、英语、日语、西班牙语、阿拉伯语(5语种)+ 跨语种迁移
推理速度前代的2.28倍(RTF 0.2065,RTX 4090 bf16)
语速控制0.5×至2.0×
发音控制中文拼音 / 英文CM音标 / 日文假名
情感控制4条路径:参考音频 / 八维情感向量 / 文本推断 / 情感描述文本
训练数据约10万小时
许可证Bilibili Model License
GitHub Stars22.7k
产品定位零样本多语种语音克隆开源TTS
适用人群配音创作者、有声书制作者、多语种内容团队、语音开发者
IndexTTS-2.5 – B站开源的零样本多语种语音克隆TTS

IndexTTS-2.5核心能力与性能

在开源TTS卷到”更大参数”的当下,IndexTTS-2.5反着走:0.8B小模型配上GRPO强化学习训练,在CV3-Eval评测里反超参数量大10倍的Moss-TTS 1.5(8B)。这延续了B站IndexTTS系列”小而准”的技术路线,GitHub仓库已收获22.7k stars。

三段式架构与强化学习

T2S→S2M→声码器的三段流水线是性能与质量的平衡点。第一段T2S(文本转语义)把文字映射到50Hz语义表征,再经语义压缩到25Hz,压缩后序列长度减半、速度翻倍;第二段S2M(语义转梅尔)采用Zipformer结构,官方盲测中56%的听感偏好超过了U-DiT的40%;第三段声码器还原音频。训练上引入GRPO(组相对策略优化)强化学习,用可听度奖励直接优化最终听感,而非只优化中间损失。

零样本克隆与多语种

约3秒参考音频即可克隆音色,5语种可跨语种迁移。比如用一段中文参考音频直接生成日语或西班牙语语音,音色保持不变——这对多语种内容本地化是刚需。发音层面支持中文拼音标注、英文CM音标和日文假名,遇到多音字、专有名词、外语名时可以手动指定读音。

四条情感控制路径

情感表达有四种控制方式按精度递进:直接用带情感的参考音频”带情绪”;八维情感向量精确量化情绪强度;由文本自动推断情感(问句自动带疑问语气);或用自然语言描述情感(”激动地说”)。配合0.5×到2.0×的语速控制,一个模型覆盖了大部分配音表达需求。

CV3-Eval实测:小模型打大模型

以下数据来自官方技术报告的CV3-Eval评测(WER为词错误率越低越好,SIM为音色相似度越高越好):

模型参数量WER(词错误率)SIM(音色相似度)
IndexTTS-2.5-RL0.8B6.0073.63
IndexTTS-2.50.8B6.7573.18
VoxCPM22B7.2272.02
Moss-TTS 1.58B9.4068.56

0.8B的IndexTTS-2.5-RL在两项指标上全面领先。对比参数量10倍于它的Moss-TTS 1.5,词错误率低3.4个百分点、音色相似度高5个点。推理速度也快:RTF(实时率)0.2065@RTX 4090,即生成1秒语音只需约0.2秒计算,是前代的2.28倍。

IndexTTS-2.5与主流开源TTS对比

对比维度IndexTTS-2.5CosyVoice 3Moss-TTS 1.5
开发方B站阿里通义MiniMax系
参数量0.8B1.5B8B
WER词错误率6.00(RL版)约6-7区间9.40
SIM音色相似度73.63约72区间68.56
推理速度RTF 0.2065@4090中等大参数较慢
语种中英日西阿5语种多语种中英为主
许可证Bilibili Model LicenseApache系各自社区许可

开源TTS赛道现在三强并立:站内的CosyVoice StudioCosyVoice语音合成代表阿里路线,生态成熟、工具链全;IndexTTS-2.5胜在单位参数效率、强化学习带来的自然度和B站社区(22.7k stars);新发布的dots.tts则在中文Seed-TTS-Eval上分数更高。按自己的语种和部署条件选即可。

IndexTTS-2.5应用场景与适用人群

  • 有声书与长文本配音:推理快(RTF 0.2)适合批量生成长音频,语速和情感可控保证听感稳定。
  • 多语种内容本地化:一个中文音色直接产出英日西阿语音,跨语种迁移省去每语种重新录音。
  • 视频配音与角色音色:零样本克隆+情感路径控制,适合需要多角色、多情绪的短视频和动画配音。
  • 语音应用开发:开源权重+WebUI(7860端口)+可商用许可(需遵守Bilibili Model License),方便集成到自有产品。

适合谁用:需要高质量中文和多语种TTS的内容创作者、有本地部署需求的语音开发者、想控制成本的有声书团队。注意的情况:商用前需确认Bilibili Model License条款;克隆他人声音需获得授权,声音权益属于人格权范畴,务必合规使用。

如何使用IndexTTS-2.5

  • 在线体验:官方和社区提供的WebUI演示可直接试听,上传3秒参考音频即可克隆。
  • 本地部署:GitHub克隆仓库,安装依赖后启动WebUI(默认7860端口),RTX 4090上bf16推理RTF约0.2,消费级显卡也能跑。
  • API式调用:仓库提供推理脚本,支持指定参考音频、情感向量、语速和拼音标注,方便接入批量生产管线。
  • 模型获取:权重托管在Hugging Face和魔搭ModelScope,国内下载ModelScope更快。

IndexTTS-2.5开源许可与已知局限

Bilibili Model License允许商用,但有附加条件。与Apache 2.0这类宽松许可不同,使用前应通读协议原文,确认署名、用途限制等义务;具体条款以官方仓库最新版本为准。

局限:5语种之外的语言(如韩语、法语)暂不支持;0.8B体量在极端复杂情感(哭泣、大笑过渡)上与更大模型仍有差距;参考音频质量直接影响克隆效果,噪音大的素材需先降噪;情感八维向量的调参有一定学习成本,新手建议先用文本推断路径。

常见问题

IndexTTS-2.5本地部署需要什么显卡?

0.8B小模型门槛不高:RTX 4090上bf16推理RTF约0.2(生成1秒音频约0.2秒计算),主流消费级显卡均可运行。权重在Hugging Face和ModelScope都可下载,国内建议用ModelScope。

IndexTTS-2.5可以商用吗?

可以,但需遵守Bilibili Model License。该许可允许商用但有附加条件(如署名要求等),商用部署前请通读官方仓库的最新协议原文,确认自己的使用场景符合条款。

IndexTTS-2.5是免费的吗?

开源免费。本地部署无任何费用,在线体验和社区演示也免费。它是B站IndexSpeech团队2026年8月10日发布的开源项目,GitHub已收获22.7k stars。

IndexTTS-2.5支持哪些语言?

中文、英语、日语、西班牙语、阿拉伯语5个语种,并支持跨语种迁移——用一段中文参考音色直接生成其他语种语音。中文多音字可用拼音标注、英文用CM音标、日文用假名控制发音。

IndexTTS-2.5和CosyVoice、dots.tts怎么选?

都要本地部署开源TTS的话:中文极致自然度看dots.tts(Seed-TTS-Eval中文CER 0.94%);生态成熟度和工具链看CosyVoice系列;追求单位参数效率、推理速度和B站社区活跃度选IndexTTS-2.5。三者均可本地免费使用,建议用自己的素材实测对比。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章