dots.tts – 小红书开源的全连续自回归语音合成模型

dots.tts是一款由小红书dots团队联合上海交大X-LANCE实验室开源的全连续自回归TTS模型,参数量20亿,主要用于零样本语音克隆与高自然度语音合成,支持48kHz高采样率输出、1T1A双流生成首包仅54.4毫秒,在Seed-TTS-Eval基准达到SOTA水平,适用于有声书、配音、播客等中文语音生产场景。

基础信息内容
开发方小红书dots团队 + 上海交通大学X-LANCE实验室
参数量2B(20亿)
技术路线全连续自回归TTS(无离散token)
输出规格48kHz高采样率
核心成绩Seed-TTS-Eval SOTA:中文CER 0.94% / SIM 81.0;平均WER 2.95% / SIM 79.2
首包延迟1T1A双流生成54.4毫秒
推理性能SGLang H100 16路并发4.76 req/s
语音编辑dots.tts.edit支持四类编辑(替换/插入/删除/改情感等)
加速方案MeanFlow 4步 / sCM 2步 / DMD 1步
许可证Apache 2.0(全套6个检查点)
产品定位全连续自回归开源语音合成模型
适用人群有声书与配音创作者、播客团队、实时语音应用开发者
dots.tts – 小红书开源的全连续自回归语音合成模型

dots.tts核心能力与性能

目前主流TTS走”离散token”路线——先把音频切成离散符号再让模型预测。dots.tts反其道而行:全连续自回归,模型直接在连续潜空间里生成音频,绕过了离散化必然带来的信息损失。官方数据显示中文Seed-TTS-Eval测试中词错误率(CER)低至0.94%、音色相似度81.0,两项都刷新了开源纪录。

全连续自回归:不用离散token的TTS

连续生成是dots.tts与绝大多数开源TTS的路线分野。传统方案将音频量化为离散token再预测,量化过程天然丢信息;dots.tts用AudioVAE(编码器为HoliTok)把音频压入连续潜空间,Qwen2.5语言模型骨干以BPE方式直接读取连续表征,配合流匹配(Flow Matching)解码头直接输出波形。整条管线没有离散化瓶颈,这是它在自然度指标上刷新纪录的架构基础。

Seed-TTS-Eval SOTA成绩单

以下数据来自官方技术报告的Seed-TTS-Eval评测(来自小红书dots团队官方发布材料):

评测维度dots.tts成绩说明
中文CER(字错误率)0.94%每百字错误不到1个字
中文SIM(音色相似度)81.0克隆音色与原声接近度
平均WER(词错误率)2.95%多语种综合水平
平均SIM79.2多语种音色保持
MiniMax对比(24语种平均SIM)MiniMax 83.9MiniMax在24语种中19个第一,dots.tts中文单项领先

客观地说:单看中文,dots.tts是开源最强;看全语种覆盖,MiniMax的闭源模型平均分更高。开源阵营内它是明确的SOTA,对比CosyVoice 3的公开数据(WER约3.06%、SIM约75.3),dots.tts两项都占优。

为实时场景设计的工程性能

54.4毫秒首包延迟达到了实时对话级别。1T1A双流架构(一条流管内容、一条流管声学)让模型开口前不需要等整句生成;SGLang优化后单张H100可16路并发、每秒4.76个请求。推理加速提供三档:MeanFlow 4步、sCM 2步、DMD 1步,速度与质量按需取舍。配套的dots.tts.edit支持替换、插入、删除、情感修改四类语音编辑——改一个词不用整段重录。

dots.tts与CosyVoice 3对比

对比维度dots.ttsCosyVoice 3
开发方小红书+上交X-LANCE阿里通义
参数量2B1.5B
技术路线全连续自回归离散token+流匹配
WER词错误率2.95%(平均)约3.06%
SIM音色相似度79.2(平均)约75.3
首包延迟54.4ms(1T1A双流)官方未公布同级数据
输出采样率48kHz24kHz
开源程度全套6个检查点部分开源
许可证Apache 2.0Apache系

两者是中文开源TTS的第一梯队对手。CosVoice生态更早、工具链成熟,站内CosyVoice语音合成CosyVoice Studio有详细介绍;dots.tts胜在指标全面领先、48kHz高采样率和Apache 2.0全套开源。同期还有B站IndexTTS-2.5主打0.8B高效率路线,可按部署条件搭配选择。

dots.tts应用场景与适用人群

  • 有声书与长音频生产:中文0.94%字错误率意味着万字文本几乎无需人工校对,批量生产效率高。
  • 实时语音交互:54.4ms首包+SGLang 16路并发,满足数字人、语音助手等对话级延迟要求。
  • 配音与播客后期:dots.tts.edit局部修改音频,替换、改情感不用整段重录。
  • 二次开发:Apache 2.0全套6个检查点开源,商用改造零许可障碍。

适合谁用:以中文为主的内容生产团队、对延迟敏感的实时语音应用开发者、需要深度定制的语音产品团队。合规提醒:零样本克隆他人声音需获得本人授权,声音权益受法律保护,商用前务必确权。

如何使用dots.tts

  • 获取权重:Hugging Face或魔搭ModelScope搜索dots团队仓库,全套6个检查点均开放下载。
  • 推理框架:官方提供推理脚本与SGLang优化方案;加速按需选MeanFlow(4步)、sCM(2步)或DMD(1步)。
  • 实时部署:启用1T1A双流模式获得54.4ms首包,配合SGLang在H100上实现16路并发。
  • 语音编辑:调用dots.tts.edit接口,指定编辑类型(替换/插入/删除/情感)与目标片段即可局部重生成。

dots.tts的官方资源

  • GitHub仓库:dots.tts
  • arXiv技术论文:https://arxiv.org/pdf/2608.02673

dots.tts开源许可与已知局限

Apache 2.0全套开源是这个项目最实在的诚意。不只是推理权重,全套6个检查点都在许可范围内,商用、修改、分发均无附加条件,比社区许可(限制营收或地域)干净得多。

局限:强项集中在中文,多语种平均分被MiniMax闭源模型压过(其24语种中19个第一);2B参数的全连续管线对显存有一定要求,极端低端设备建议看IndexTTS-2.5的0.8B方案;1步加速(DMD)模式的质量损失需要自己评估;作为学术合作项目,工程文档和issue响应节奏与商业产品不同,深度集成要做好自行排查的准备。

常见问题

dots.tts本地部署需要什么配置?

2B参数模型,主流消费级和专业级显卡均可运行。追求实时性能建议A100/H100级别配合SGLang(16路并发、4.76 req/s);日常批量生成消费级显卡即可。权重在Hugging Face和ModelScope免费下载。

dots.tts可以商用吗?

可以。采用Apache 2.0许可证且全套6个检查点开源,商用、修改、分发无附加条件,是目前许可最干净的开源TTS之一。注意克隆他人声音需获得声音本人授权。

dots.tts是免费的吗?

完全免费开源。由小红书dots团队与上海交大X-LANCE实验室联合发布,本地部署无任何费用,无API强制收费。

dots.tts和CosyVoice 3哪个好?

公开数据上dots.tts全面领先:WER 2.95%对约3.06%,SIM 79.2对约75.3,采样率48kHz对24kHz,且Apache 2.0全套开源。CosyVoice的优势是生态更早、工具链和社区资料更多。中文质量优先选dots.tts,生态成熟度优先选CosyVoice。

dots.tts支持语音编辑吗?

支持。配套的dots.tts.edit提供四类编辑能力:替换片段、插入内容、删除片段、修改情感,改一处不用整段重录,对配音和播客后期非常实用。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章