FireRedTTS3是一款由小红书 FireRed 团队于 2026 年 8 月推出的统一语音生成与编辑模型,主要用于多语言语音合成与零样本音色克隆,支持 24 种语言与 21 种中文方言的克隆与基于自然语言的声音设计,适用于学术研究、跨语种内容创作与语音编辑场景。
| 基础信息 | 内容 |
|---|---|
| 开发团队 | 小红书 FireRed Team |
| 首发时间 | 2026 年 8 月 21 日(模型首发)/ 2026 年 8 月 5 日(Base 公开) |
| 产品定位 | 统一语音生成与编辑模型(TTS + 语音编辑二合一) |
| 开源协议 | Apache-2.0 |
| 模型权重 | HuggingFace:FireRedTeam/FireRedTTS3(Base + Instruct 双版本) |
| 技术报告 | arXiv 编号 2608.17492(详见下方”开发时间线”) |
| 支持语种 | 24 种语言 + 21 种中文方言 |
| 关键评测 | Seed-TTS-eval WER/CER 3.04% / 相似度 78.8 双第一 |
| 学术用途 | 零样本克隆功能仅限学术研究,禁止非法用途 |

FireRedTTS3的核心能力
FireRedTTS3 与传统 TTS 模型的关键差异在于”统一性”——一个模型同时覆盖合成、克隆、设计与编辑四类任务。
RedAE加LLM-DiT的双轨架构
RedAE 训练时冻结一个语音编码器作为”语义老师”对中间语音表征做语义蒸馏,推理时该编码器被直接丢弃,不增加运行时开销;LLM-DiT 端到端完成文本到声学 token 生成,由 DiT 做 patch 级自回归去噪并采样 24 kHz 波形。同一套权重既能完成克隆,也能完成编辑与设计。
四项核心能力亮点
- 多语言覆盖:单模型支持 24 种语言 + 21 种中文方言的零样本克隆
- 声音设计与编辑:根据性别、年龄、音色等自然语言描述生成全新声音;同时支持语义级插入/删除/替换与速度/音高/音量等声学参数调节
- 开源权重:Base 与 Instruct 两版本均开放下载,Apache-2.0 协议可二次开发
开发时间线
- 2026 年 8 月 5 日:FireRedTTS3-Base 权重于 HuggingFace 首发。
- 8 月 13 日:Instruct 版本与 PyTorch 推理脚本 GitHub 同步发布。
- 8 月 21 日:机器之心等权威媒体集中首报;arXiv 编号 2608.17492 v2 修订版同日上线。
FireRedTTS3与主流TTS模型的对比
把 FireRedTTS3 放在当前主流开源 TTS 模型里比较,可以更直观看出它在多语种克隆与编辑能力上的位置。对比聚焦团队、协议、语种、克隆方式、编辑能力与客观评测六个维度。
| 对比维度 | FireRedTTS3 | IndexTTS-2.5 | CosyVoice 2.0 |
|---|---|---|---|
| 所属团队 | 小红书 FireRed Team | B 站(哔哩哔哩) | 阿里通义实验室 |
| 发布时间 | 2026 年 8 月 13 日 | 2025 年 8 月 | 2024 年 8 月 |
| 协议/语种 | Apache-2.0;24 种语言 + 21 种中文方言 | Apache-2.0;约 8 种语言 | Apache-2.0;约 9 种语言 |
| 克隆方式 | 单模型内置 + 自然语言声音描述 | 参考音频,模型独立训练 | 参考音频,跨语种能力有限 |
| 编辑能力 | 语义级插入/删除/替换 + 声学参数 | 以合成为主 | 以合成为主 |
| Seed-TTS-eval WER/CER | 3.04%(最低) | 3.94% 左右 | 3.6% 左右 |
注:对比数据来自 FireRedTTS3 官方 README(2026 年 8 月 13 日版本)与各对手官方公开成绩,便于横向参考。
从官方数据可以看出,FireRedTTS3 同时拿下 Seed-TTS-eval 与 MiniMax-MLS-Test 两个数据集的 WER/CER 与相似度双指标第一,叠加 24 种语言 + 21 种中文方言的单模型覆盖,明显拉开与同代开源 TTS 的差距;零样本克隆之外内置语义级编辑能力,是它与传统合成模型最显著的差异。
相关站内参考:IndexTTS-2.5、CosyVoice 2.0、dots.tts。
FireRedTTS3的应用场景与适用人群
结合官方资料与评测表现来看,FireRedTTS3 更偏向研究型与创作型场景,因此适用人群与典型商用 TTS 产品略有差异。
- 多语种有声内容:同一段文本快速合成中、英、日、韩等多语种语音,做有声书、播客、短视频配音
- 方言与本地化:粤、川、沪、闽南、温州等方言克隆应用于本地化播报、文旅讲解与方言教学
- 声音设计与编辑研究:游戏 NPC、广告用自然语言描述即可生成音色参考样本;编辑接口支持语义级插入/删除/替换与声学参数调节
适用人群:语音合成研究者、TTS 算法工程师、多语种内容创作者、方言保护与本地化从业者、需要自定义声音设计的游戏与广告团队,以及关注开源语音技术的高校学生。官方明确零样本克隆”仅限学术研究”且禁止非法用途,商业产品上线前应再次评估合规边界。
如何使用FireRedTTS3
使用前的环境准备
- 环境建议 RTX 4090 或同级显卡,A100/H800 推荐用于完整推理;系统选 Linux + Python 3.10 + PyTorch 2.1+
- 需能访问 HuggingFace / ModelScope,用于下载 Base 与 Instruct 模型权重
使用步骤
- 克隆仓库并安装依赖:用
git clone拉取官方仓库后执行pip install -r requirements.txt,再从 HuggingFace / ModelScope 将 Base 与 Instruct 权重放入checkpoints/目录 - 运行推理脚本:参照仓库
examples/目录下的infer_tts.py与infer_edit.py,分别完成克隆与编辑两类推理 - 调整声学参数:按 speed ∈ [0.5, 2.0]、pitch ∈ ±1~±6、volume ∈ [0.3, 2.0] 区间调节输出
完整操作细节、最新参数范围与示例脚本请参考 FireRedTTS3 官方仓库。
FireRedTTS3的开源情况与价格
- 开源协议:Apache-2.0,可下载、修改、再发布,需保留版权
- 使用与商用边界:研究、学习场景可自由下载权重与代码;零样本克隆功能限定学术研究并禁止非法用途;商业集成需自行评估合规风险
版本与数据来源:代码与权重见 GitHub FireRedTeam 组织下的 FireRedTTS3 仓库及 HuggingFace / ModelScope 同名模型页;技术报告 arXiv 编号 2608.17492(2026 年 8 月 18 日 v1、8 月 21 日 v2 修订);评测数据见机器之心 2026 年 8 月 21 日首发评测(Seed-TTS-eval WER 3.04% / 相似度 78.8);版本迭代请以官方仓库 README 最新版为准。
FireRedTTS3常见问题
FireRedTTS3 与 CosyVoice 2.0 有什么核心差异?
两者都开源、都支持中英合成,差异在语种覆盖与编辑能力:FireRedTTS3 支持 24 种语言 + 21 种中文方言、内置声音设计与语义编辑,Seed-TTS-eval WER/CER 3.04%、MiniMax-MLS-Test 相似度 84.8 双第一;CosyVoice 2.0 更偏稳态中文合成,未公开 24 语言综合成绩。
零样本音色克隆是否支持任意参考音频?
官方 README 明确零样本克隆”仅限学术研究,禁止任何非法用途”,且参考音频应清晰、无背景噪音;克隆效果最佳实践是用与目标语种一致的参考音频,如克隆粤语时使用粤语 prompt。
能否用自然语言凭空生成一个全新声音?
可以。FireRedTTS3 的 Instruct 版本支持在无参考音频的情况下,根据性别、年龄、音色、情感、语速、口音等自然语言描述生成全新声音,模型先做文本层面的显式规划再合成音频。
FireRedTTS3 能否商用?
Apache-2.0 协议允许商用,但官方 Usage Disclaimer 把零样本克隆限定为”仅学术研究”,并禁止任何非法用途;商业产品接入前应再次评估合规边界。
浙公网安备33010202004812号