dots.tts是一款由小红书dots团队联合上海交大X-LANCE实验室开源的全连续自回归TTS模型,参数量20亿,主要用于零样本语音克隆与高自然度语音合成,支持48kHz高采样率输出、1T1A双流生成首包仅54.4毫秒,在Seed-TTS-Eval基准达到SOTA水平,适用于有声书、配音、播客等中文语音生产场景。
| 基础信息 | 内容 |
|---|---|
| 开发方 | 小红书dots团队 + 上海交通大学X-LANCE实验室 |
| 参数量 | 2B(20亿) |
| 技术路线 | 全连续自回归TTS(无离散token) |
| 输出规格 | 48kHz高采样率 |
| 核心成绩 | Seed-TTS-Eval SOTA:中文CER 0.94% / SIM 81.0;平均WER 2.95% / SIM 79.2 |
| 首包延迟 | 1T1A双流生成54.4毫秒 |
| 推理性能 | SGLang H100 16路并发4.76 req/s |
| 语音编辑 | dots.tts.edit支持四类编辑(替换/插入/删除/改情感等) |
| 加速方案 | MeanFlow 4步 / sCM 2步 / DMD 1步 |
| 许可证 | Apache 2.0(全套6个检查点) |
| 产品定位 | 全连续自回归开源语音合成模型 |
| 适用人群 | 有声书与配音创作者、播客团队、实时语音应用开发者 |

dots.tts核心能力与性能
目前主流TTS走”离散token”路线——先把音频切成离散符号再让模型预测。dots.tts反其道而行:全连续自回归,模型直接在连续潜空间里生成音频,绕过了离散化必然带来的信息损失。官方数据显示中文Seed-TTS-Eval测试中词错误率(CER)低至0.94%、音色相似度81.0,两项都刷新了开源纪录。
全连续自回归:不用离散token的TTS
连续生成是dots.tts与绝大多数开源TTS的路线分野。传统方案将音频量化为离散token再预测,量化过程天然丢信息;dots.tts用AudioVAE(编码器为HoliTok)把音频压入连续潜空间,Qwen2.5语言模型骨干以BPE方式直接读取连续表征,配合流匹配(Flow Matching)解码头直接输出波形。整条管线没有离散化瓶颈,这是它在自然度指标上刷新纪录的架构基础。
Seed-TTS-Eval SOTA成绩单
以下数据来自官方技术报告的Seed-TTS-Eval评测(来自小红书dots团队官方发布材料):
| 评测维度 | dots.tts成绩 | 说明 |
|---|---|---|
| 中文CER(字错误率) | 0.94% | 每百字错误不到1个字 |
| 中文SIM(音色相似度) | 81.0 | 克隆音色与原声接近度 |
| 平均WER(词错误率) | 2.95% | 多语种综合水平 |
| 平均SIM | 79.2 | 多语种音色保持 |
| MiniMax对比(24语种平均SIM) | MiniMax 83.9 | MiniMax在24语种中19个第一,dots.tts中文单项领先 |
客观地说:单看中文,dots.tts是开源最强;看全语种覆盖,MiniMax的闭源模型平均分更高。开源阵营内它是明确的SOTA,对比CosyVoice 3的公开数据(WER约3.06%、SIM约75.3),dots.tts两项都占优。
为实时场景设计的工程性能
54.4毫秒首包延迟达到了实时对话级别。1T1A双流架构(一条流管内容、一条流管声学)让模型开口前不需要等整句生成;SGLang优化后单张H100可16路并发、每秒4.76个请求。推理加速提供三档:MeanFlow 4步、sCM 2步、DMD 1步,速度与质量按需取舍。配套的dots.tts.edit支持替换、插入、删除、情感修改四类语音编辑——改一个词不用整段重录。
dots.tts与CosyVoice 3对比
| 对比维度 | dots.tts | CosyVoice 3 |
|---|---|---|
| 开发方 | 小红书+上交X-LANCE | 阿里通义 |
| 参数量 | 2B | 1.5B |
| 技术路线 | 全连续自回归 | 离散token+流匹配 |
| WER词错误率 | 2.95%(平均) | 约3.06% |
| SIM音色相似度 | 79.2(平均) | 约75.3 |
| 首包延迟 | 54.4ms(1T1A双流) | 官方未公布同级数据 |
| 输出采样率 | 48kHz | 24kHz |
| 开源程度 | 全套6个检查点 | 部分开源 |
| 许可证 | Apache 2.0 | Apache系 |
两者是中文开源TTS的第一梯队对手。CosVoice生态更早、工具链成熟,站内CosyVoice语音合成与CosyVoice Studio有详细介绍;dots.tts胜在指标全面领先、48kHz高采样率和Apache 2.0全套开源。同期还有B站IndexTTS-2.5主打0.8B高效率路线,可按部署条件搭配选择。
dots.tts应用场景与适用人群
- 有声书与长音频生产:中文0.94%字错误率意味着万字文本几乎无需人工校对,批量生产效率高。
- 实时语音交互:54.4ms首包+SGLang 16路并发,满足数字人、语音助手等对话级延迟要求。
- 配音与播客后期:dots.tts.edit局部修改音频,替换、改情感不用整段重录。
- 二次开发:Apache 2.0全套6个检查点开源,商用改造零许可障碍。
适合谁用:以中文为主的内容生产团队、对延迟敏感的实时语音应用开发者、需要深度定制的语音产品团队。合规提醒:零样本克隆他人声音需获得本人授权,声音权益受法律保护,商用前务必确权。
如何使用dots.tts
- 获取权重:Hugging Face或魔搭ModelScope搜索dots团队仓库,全套6个检查点均开放下载。
- 推理框架:官方提供推理脚本与SGLang优化方案;加速按需选MeanFlow(4步)、sCM(2步)或DMD(1步)。
- 实时部署:启用1T1A双流模式获得54.4ms首包,配合SGLang在H100上实现16路并发。
- 语音编辑:调用
dots.tts.edit接口,指定编辑类型(替换/插入/删除/情感)与目标片段即可局部重生成。
dots.tts的官方资源
- GitHub仓库:dots.tts
- arXiv技术论文:https://arxiv.org/pdf/2608.02673
dots.tts开源许可与已知局限
Apache 2.0全套开源是这个项目最实在的诚意。不只是推理权重,全套6个检查点都在许可范围内,商用、修改、分发均无附加条件,比社区许可(限制营收或地域)干净得多。
局限:强项集中在中文,多语种平均分被MiniMax闭源模型压过(其24语种中19个第一);2B参数的全连续管线对显存有一定要求,极端低端设备建议看IndexTTS-2.5的0.8B方案;1步加速(DMD)模式的质量损失需要自己评估;作为学术合作项目,工程文档和issue响应节奏与商业产品不同,深度集成要做好自行排查的准备。
常见问题
dots.tts本地部署需要什么配置?
2B参数模型,主流消费级和专业级显卡均可运行。追求实时性能建议A100/H100级别配合SGLang(16路并发、4.76 req/s);日常批量生成消费级显卡即可。权重在Hugging Face和ModelScope免费下载。
dots.tts可以商用吗?
可以。采用Apache 2.0许可证且全套6个检查点开源,商用、修改、分发无附加条件,是目前许可最干净的开源TTS之一。注意克隆他人声音需获得声音本人授权。
dots.tts是免费的吗?
完全免费开源。由小红书dots团队与上海交大X-LANCE实验室联合发布,本地部署无任何费用,无API强制收费。
dots.tts和CosyVoice 3哪个好?
公开数据上dots.tts全面领先:WER 2.95%对约3.06%,SIM 79.2对约75.3,采样率48kHz对24kHz,且Apache 2.0全套开源。CosyVoice的优势是生态更早、工具链和社区资料更多。中文质量优先选dots.tts,生态成熟度优先选CosyVoice。
dots.tts支持语音编辑吗?
支持。配套的dots.tts.edit提供四类编辑能力:替换片段、插入内容、删除片段、修改情感,改一处不用整段重录,对配音和播客后期非常实用。
浙公网安备33010202004812号