FireRedAudio是一款由小红书 FireRed 团队于 2026 年 8 月推出的通用音频语言模型,基于 Qwen3.5 架构、参数量 9B,用解耦连续表征把音频理解与生成统一进同一个 LLM,单模型覆盖语音识别、音频问答、长音频理解、语音克隆与语音编辑等任务,已在 GitHub 与 Hugging Face 开源。
| 基础信息 | 内容 |
|---|---|
| 开发团队 | 小红书 FireRed 团队 |
| 发布时间 | 2026 年 8 月 21 日 |
| 产品定位 | 通用音频语言模型(理解 + 生成统一) |
| 基础架构 | 基于 Qwen3.5 架构 |
| 模型规模 | 9B |
| 开源协议 | Apache-2.0 |
| 支持任务 | ASR、音频问答、长音频理解、语音克隆、语音编辑 |
| 关键评测 | MMAU 三项 82.0 / 80.9 / 83.3 第一;FLEURS-102 错误率 14.94% |

FireRedAudio 的核心能力
与偏合成的 CosyVoice 2.0 等语音模型不同,FireRedAudio 把”听懂”和”开口 / 改录音”放进同一个 9B 主干,而不是把多条独立流水线拼起来;它更接近一个”音频版的通用语言模型”,而非单一用途的语音工具。
解耦连续表征的统一音频架构
FireRedAudio 用解耦的连续表征让”理解”与”生成”各走独立通路,再汇入同一个 LLM;这种结构让单一模型既能做语音识别与音频问答,也能做语音克隆与编辑,避免了传统方案里 ASR、TTS、编辑各管一段带来的误差累积与运维成本。模型基于 Qwen3.5 架构、参数量 9B。
多任务统一覆盖
- 语音识别(ASR):高准确度的多语种语音转写
- 音频问答:对一段音频提问并给出自然语言回答
- 长音频理解:支持约 1 小时长音频的上下文理解
- 语音克隆:从参考音频生成目标音色
- 语音编辑:在已有音频上做插入 / 删除 / 替换
- 统一主干:理解与生成共享同一 9B LLM,无需拼接多个流水线
这种”理解—生成解耦再融合”的结构,让模型在音频问答时能看到自己的生成表征,在语音编辑时也能理解上下文语义,从而把传统上需要 ASR + LLM + TTS 三段拼接的流程收敛到一个主干里。它也让”先理解再生成”类任务更容易复用同一套上下文:比如先听完一段会议录音、再对其中某句话做语义级编辑,模型不必在两条流水线之间搬运中间结果,编辑的位置也能与理解到的语义直接对齐。在部署形态上,9B 主干更适合服务端批量推理;若要做端侧或实时场景,可结合量化与流式解码进一步压低延迟,官方示例已覆盖常见的推理封装方式。
FireRedAudio 与主流音频 / 语音模型对比
把 FireRedAudio 与当前主流的音频 / 语音模型放在一起比较,可以更直观看到它”统一音频 LM”定位的差异。对比聚焦团队、架构、任务覆盖、关键评测与协议五个维度。
| 对比维度 | FireRedAudio | CosyVoice 2.0 | Qwen-Audio-3.0-Realtime |
|---|---|---|---|
| 所属团队 | 小红书 FireRed | 阿里通义 | 阿里通义千问 |
| 架构 | Qwen3.5 9B 统一音频 LM | 扩散 / 自回归 TTS | 实时语音交互模型 |
| 参数规模 | 9B | 未公开(约数 B) | 未公开 |
| 任务覆盖 | ASR / 问答 / 长音频 / 克隆 / 编辑 | 以语音合成为主 | 以实时语音对话为主 |
| 关键评测 | MMAU 三项第一;FLEURS-102 14.94% | 高保真中文合成 | 低延迟实时交互 |
| 开源协议 | Apache-2.0 | Apache-2.0 | 未完全开源 |
注:对比数据来自各模型官方 README 与公开评测(MMAU / FLEURS-102),仅作横向参考。
从官方数据可以看出,FireRedAudio 的差异化在于用单一 9B 主干把”听懂”和”开口 / 改录音”统一,而非拼装独立的 TTS、ASR 流水线;MMAU 三个子任务均列第一、FLEURS-102 多语种识别错误率 14.94%,在统一音频模型里属于第一梯队,对需要”理解 + 生成”一体化的音频应用尤其有意义。
相关站内参考:IndexTTS-2.5、Qwen-Audio-3.0-Realtime。
如果你的需求只是高保真中文配音,CosyVoice 2.0 仍是成熟选择;但当产品需要”先听懂再开口”,比如会议助手、播客智能剪辑这类既要理解又要生成的场景,FireRedAudio 的统一主干会比拼装流水线更省心,也更容易在单一服务里维护。此外,约 1 小时的长音频理解与秒级时间定位能力,让它在会议纪要、播客整理、访谈分析这类”按内容反查时间点”的场景里具备独立价值,而这正是传统 ASR + 编辑拼装方案最难做好的部分。
与同团队此前开源的 FireRedTTS3 相比,FireRedAudio 把能力边界从语音生成扩展到了统一的音频理解与生成。
FireRedAudio 的应用场景与适用人群
结合官方评测与模型定位来看,FireRedAudio 更偏向”音频理解 + 生成”一体化的应用,例如电商客服可用它把长时通话转写后再做要点问答,教育团队可把课程录音转成带克隆音色的精讲音频,因此适用人群覆盖内容创作者与音频应用开发者。
- 智能音频助手:用语音问答 + 长音频理解做会议记录、播客要点提取与口语化问答
- 多语种内容生产:ASR 转写配合语音克隆 / 编辑,做跨语种配音与有声内容二次创作
- 语音编辑与修复:对已有录音做语义级插入 / 删除 / 替换,快速改稿无需重录
适用人群:音频应用开发者、播客与短视频创作者、做会议 / 客服语音分析的团队、需要语音克隆与编辑的内容工作室,以及研究统一音频建模的高校研究者。相比拼装多条流水线,单模型方案对中小团队更省运维。
如何使用 FireRedAudio
使用前的环境准备
- 运行环境:Linux + Python 3.10 + PyTorch 2.1+,推理显存约 20GB 级(9B 档),需 CUDA 与 ffmpeg
- 权重来源:需能访问 Hugging Face / ModelScope,用于下载 FireRedAudio 9B 权重
快速接入步骤
- 克隆仓库:执行 git clone https://github.com/FireRedTeam/FireRedAudio.git 进入项目根目录
- 安装依赖与权重:执行 pip install -r requirements.txt,从 Hugging Face / ModelScope 拉取 9B 权重
- 运行推理:参照 examples 目录下的 ASR、音频问答、克隆与编辑脚本分别体验
- 接入业务:把模型封装为本地服务,按 ASR / 问答 / 克隆 / 编辑四类接口接入应用
完整接口、示例与最新评测请参考 FireRedAudio 官方仓库。
FireRedAudio 的价格与开源情况
FireRedAudio 以 Apache-2.0 协议开源,9B 权重与代码已在 GitHub、Hugging Face 与 ModelScope 开放,可免费用于研究、学习与商业集成,商用无授权费。
模型基于 Qwen3.5 架构,二次开发需保留许可证声明;需注意语音克隆功能官方声明仅限学术研究用途、禁止非法使用,商用落地前应确认参考音频的授权来源。官方未提供按量计费的托管 API,实际推理需自备算力。
FireRedAudio 常见问题
FireRedAudio 与 FireRedTTS3 有什么区别?
FireRedAudio 是统一音频语言模型,覆盖 ASR、音频问答、长音频理解、语音克隆与编辑等任务;FireRedTTS3 聚焦于语音生成与编辑,两者同属小红书 FireRed 团队、能力互补。
FireRedAudio 支持多长的音频理解?
官方披露支持约 1 小时长音频的上下文理解,适合会议、课程、播客等长内容处理,无需切片拼接。
语音克隆是否需要参考音频?
语音克隆任务需要清晰的目标音色参考音频;克隆效果建议参考音频与目标任务语种一致,以保证音色还原度。
FireRedAudio 能否商用?
Apache-2.0 允许商用,但涉及语音克隆与音色时建议评估授权与合规边界,避免侵权风险。
浙公网安备33010202004812号