FireRedTTS3 – 小红书推出的统一语音生成与编辑模型

AI模型10小时前更新 智小研
19 0

FireRedTTS3是一款由小红书 FireRed 团队于 2026 年 8 月推出的统一语音生成与编辑模型,主要用于多语言语音合成与零样本音色克隆,支持 24 种语言与 21 种中文方言的克隆与基于自然语言的声音设计,适用于学术研究、跨语种内容创作与语音编辑场景。

基础信息内容
开发团队小红书 FireRed Team
首发时间2026 年 8 月 21 日(模型首发)/ 2026 年 8 月 5 日(Base 公开)
产品定位统一语音生成与编辑模型(TTS + 语音编辑二合一)
开源协议Apache-2.0
模型权重HuggingFace:FireRedTeam/FireRedTTS3(Base + Instruct 双版本)
技术报告arXiv 编号 2608.17492(详见下方”开发时间线”)
支持语种24 种语言 + 21 种中文方言
关键评测Seed-TTS-eval WER/CER 3.04% / 相似度 78.8 双第一
学术用途零样本克隆功能仅限学术研究,禁止非法用途
FireRedTTS3 – 小红书推出的统一语音生成与编辑模型

FireRedTTS3的核心能力

FireRedTTS3 与传统 TTS 模型的关键差异在于”统一性”——一个模型同时覆盖合成、克隆、设计与编辑四类任务。

RedAE加LLM-DiT的双轨架构

RedAE 训练时冻结一个语音编码器作为”语义老师”对中间语音表征做语义蒸馏,推理时该编码器被直接丢弃,不增加运行时开销;LLM-DiT 端到端完成文本到声学 token 生成,由 DiT 做 patch 级自回归去噪并采样 24 kHz 波形。同一套权重既能完成克隆,也能完成编辑与设计。

四项核心能力亮点

  • 多语言覆盖:单模型支持 24 种语言 + 21 种中文方言的零样本克隆
  • 声音设计与编辑:根据性别、年龄、音色等自然语言描述生成全新声音;同时支持语义级插入/删除/替换与速度/音高/音量等声学参数调节
  • 开源权重:Base 与 Instruct 两版本均开放下载,Apache-2.0 协议可二次开发

开发时间线

  • 2026 年 8 月 5 日:FireRedTTS3-Base 权重于 HuggingFace 首发。
  • 8 月 13 日:Instruct 版本与 PyTorch 推理脚本 GitHub 同步发布。
  • 8 月 21 日:机器之心等权威媒体集中首报;arXiv 编号 2608.17492 v2 修订版同日上线。

FireRedTTS3与主流TTS模型的对比

把 FireRedTTS3 放在当前主流开源 TTS 模型里比较,可以更直观看出它在多语种克隆与编辑能力上的位置。对比聚焦团队、协议、语种、克隆方式、编辑能力与客观评测六个维度。

对比维度FireRedTTS3IndexTTS-2.5CosyVoice 2.0
所属团队小红书 FireRed TeamB 站(哔哩哔哩)阿里通义实验室
发布时间2026 年 8 月 13 日2025 年 8 月2024 年 8 月
协议/语种Apache-2.0;24 种语言 + 21 种中文方言Apache-2.0;约 8 种语言Apache-2.0;约 9 种语言
克隆方式单模型内置 + 自然语言声音描述参考音频,模型独立训练参考音频,跨语种能力有限
编辑能力语义级插入/删除/替换 + 声学参数以合成为主以合成为主
Seed-TTS-eval WER/CER3.04%(最低)3.94% 左右3.6% 左右

注:对比数据来自 FireRedTTS3 官方 README(2026 年 8 月 13 日版本)与各对手官方公开成绩,便于横向参考。

从官方数据可以看出,FireRedTTS3 同时拿下 Seed-TTS-eval 与 MiniMax-MLS-Test 两个数据集的 WER/CER 与相似度双指标第一,叠加 24 种语言 + 21 种中文方言的单模型覆盖,明显拉开与同代开源 TTS 的差距;零样本克隆之外内置语义级编辑能力,是它与传统合成模型最显著的差异。

相关站内参考:IndexTTS-2.5CosyVoice 2.0dots.tts

FireRedTTS3的应用场景与适用人群

结合官方资料与评测表现来看,FireRedTTS3 更偏向研究型与创作型场景,因此适用人群与典型商用 TTS 产品略有差异。

  • 多语种有声内容:同一段文本快速合成中、英、日、韩等多语种语音,做有声书、播客、短视频配音
  • 方言与本地化:粤、川、沪、闽南、温州等方言克隆应用于本地化播报、文旅讲解与方言教学
  • 声音设计与编辑研究:游戏 NPC、广告用自然语言描述即可生成音色参考样本;编辑接口支持语义级插入/删除/替换与声学参数调节

适用人群:语音合成研究者、TTS 算法工程师、多语种内容创作者、方言保护与本地化从业者、需要自定义声音设计的游戏与广告团队,以及关注开源语音技术的高校学生。官方明确零样本克隆”仅限学术研究”且禁止非法用途,商业产品上线前应再次评估合规边界。

如何使用FireRedTTS3

使用前的环境准备

  • 环境建议 RTX 4090 或同级显卡,A100/H800 推荐用于完整推理;系统选 Linux + Python 3.10 + PyTorch 2.1+
  • 需能访问 HuggingFace / ModelScope,用于下载 Base 与 Instruct 模型权重

使用步骤

  1. 克隆仓库并安装依赖:用 git clone 拉取官方仓库后执行 pip install -r requirements.txt,再从 HuggingFace / ModelScope 将 Base 与 Instruct 权重放入 checkpoints/ 目录
  2. 运行推理脚本:参照仓库 examples/ 目录下的 infer_tts.pyinfer_edit.py,分别完成克隆与编辑两类推理
  3. 调整声学参数:按 speed ∈ [0.5, 2.0]、pitch ∈ ±1~±6、volume ∈ [0.3, 2.0] 区间调节输出

完整操作细节、最新参数范围与示例脚本请参考 FireRedTTS3 官方仓库

FireRedTTS3的开源情况与价格

  • 开源协议:Apache-2.0,可下载、修改、再发布,需保留版权
  • 使用与商用边界:研究、学习场景可自由下载权重与代码;零样本克隆功能限定学术研究并禁止非法用途;商业集成需自行评估合规风险

版本与数据来源:代码与权重见 GitHub FireRedTeam 组织下的 FireRedTTS3 仓库及 HuggingFace / ModelScope 同名模型页;技术报告 arXiv 编号 2608.17492(2026 年 8 月 18 日 v1、8 月 21 日 v2 修订);评测数据见机器之心 2026 年 8 月 21 日首发评测(Seed-TTS-eval WER 3.04% / 相似度 78.8);版本迭代请以官方仓库 README 最新版为准。

FireRedTTS3常见问题

FireRedTTS3 与 CosyVoice 2.0 有什么核心差异?

两者都开源、都支持中英合成,差异在语种覆盖与编辑能力:FireRedTTS3 支持 24 种语言 + 21 种中文方言、内置声音设计与语义编辑,Seed-TTS-eval WER/CER 3.04%、MiniMax-MLS-Test 相似度 84.8 双第一;CosyVoice 2.0 更偏稳态中文合成,未公开 24 语言综合成绩。

零样本音色克隆是否支持任意参考音频?

官方 README 明确零样本克隆”仅限学术研究,禁止任何非法用途”,且参考音频应清晰、无背景噪音;克隆效果最佳实践是用与目标语种一致的参考音频,如克隆粤语时使用粤语 prompt。

能否用自然语言凭空生成一个全新声音?

可以。FireRedTTS3 的 Instruct 版本支持在无参考音频的情况下,根据性别、年龄、音色、情感、语速、口音等自然语言描述生成全新声音,模型先做文本层面的显式规划再合成音频。

FireRedTTS3 能否商用?

Apache-2.0 协议允许商用,但官方 Usage Disclaimer 把零样本克隆限定为”仅学术研究”,并禁止任何非法用途;商业产品接入前应再次评估合规边界。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章