FireRedAudio – 小红书FireRed团队推出的通用音频语言模型

AI模型6天前更新 智小研
49 0

FireRedAudio是一款由小红书 FireRed 团队于 2026 年 8 月推出的通用音频语言模型,基于 Qwen3.5 架构、参数量 9B,用解耦连续表征把音频理解与生成统一进同一个 LLM,单模型覆盖语音识别、音频问答、长音频理解、语音克隆与语音编辑等任务,已在 GitHub 与 Hugging Face 开源。

基础信息内容
开发团队小红书 FireRed 团队
发布时间2026 年 8 月 21 日
产品定位通用音频语言模型(理解 + 生成统一)
基础架构基于 Qwen3.5 架构
模型规模9B
开源协议Apache-2.0
支持任务ASR、音频问答、长音频理解、语音克隆、语音编辑
关键评测MMAU 三项 82.0 / 80.9 / 83.3 第一;FLEURS-102 错误率 14.94%
FireRedAudio – 小红书FireRed团队推出的通用音频语言模型

FireRedAudio 的核心能力

与偏合成的 CosyVoice 2.0 等语音模型不同,FireRedAudio 把”听懂”和”开口 / 改录音”放进同一个 9B 主干,而不是把多条独立流水线拼起来;它更接近一个”音频版的通用语言模型”,而非单一用途的语音工具。

解耦连续表征的统一音频架构

FireRedAudio 用解耦的连续表征让”理解”与”生成”各走独立通路,再汇入同一个 LLM;这种结构让单一模型既能做语音识别与音频问答,也能做语音克隆与编辑,避免了传统方案里 ASR、TTS、编辑各管一段带来的误差累积与运维成本。模型基于 Qwen3.5 架构、参数量 9B。

多任务统一覆盖

  • 语音识别(ASR):高准确度的多语种语音转写
  • 音频问答:对一段音频提问并给出自然语言回答
  • 长音频理解:支持约 1 小时长音频的上下文理解
  • 语音克隆:从参考音频生成目标音色
  • 语音编辑:在已有音频上做插入 / 删除 / 替换
  • 统一主干:理解与生成共享同一 9B LLM,无需拼接多个流水线

这种”理解—生成解耦再融合”的结构,让模型在音频问答时能看到自己的生成表征,在语音编辑时也能理解上下文语义,从而把传统上需要 ASR + LLM + TTS 三段拼接的流程收敛到一个主干里。它也让”先理解再生成”类任务更容易复用同一套上下文:比如先听完一段会议录音、再对其中某句话做语义级编辑,模型不必在两条流水线之间搬运中间结果,编辑的位置也能与理解到的语义直接对齐。在部署形态上,9B 主干更适合服务端批量推理;若要做端侧或实时场景,可结合量化与流式解码进一步压低延迟,官方示例已覆盖常见的推理封装方式。

FireRedAudio 与主流音频 / 语音模型对比

把 FireRedAudio 与当前主流的音频 / 语音模型放在一起比较,可以更直观看到它”统一音频 LM”定位的差异。对比聚焦团队、架构、任务覆盖、关键评测与协议五个维度。

对比维度FireRedAudioCosyVoice 2.0Qwen-Audio-3.0-Realtime
所属团队小红书 FireRed阿里通义阿里通义千问
架构Qwen3.5 9B 统一音频 LM扩散 / 自回归 TTS实时语音交互模型
参数规模9B未公开(约数 B)未公开
任务覆盖ASR / 问答 / 长音频 / 克隆 / 编辑以语音合成为主以实时语音对话为主
关键评测MMAU 三项第一;FLEURS-102 14.94%高保真中文合成低延迟实时交互
开源协议Apache-2.0Apache-2.0未完全开源

注:对比数据来自各模型官方 README 与公开评测(MMAU / FLEURS-102),仅作横向参考。

从官方数据可以看出,FireRedAudio 的差异化在于用单一 9B 主干把”听懂”和”开口 / 改录音”统一,而非拼装独立的 TTS、ASR 流水线;MMAU 三个子任务均列第一、FLEURS-102 多语种识别错误率 14.94%,在统一音频模型里属于第一梯队,对需要”理解 + 生成”一体化的音频应用尤其有意义。

相关站内参考:IndexTTS-2.5Qwen-Audio-3.0-Realtime

如果你的需求只是高保真中文配音,CosyVoice 2.0 仍是成熟选择;但当产品需要”先听懂再开口”,比如会议助手、播客智能剪辑这类既要理解又要生成的场景,FireRedAudio 的统一主干会比拼装流水线更省心,也更容易在单一服务里维护。此外,约 1 小时的长音频理解与秒级时间定位能力,让它在会议纪要、播客整理、访谈分析这类”按内容反查时间点”的场景里具备独立价值,而这正是传统 ASR + 编辑拼装方案最难做好的部分。

与同团队此前开源的 FireRedTTS3 相比,FireRedAudio 把能力边界从语音生成扩展到了统一的音频理解与生成。

FireRedAudio 的应用场景与适用人群

结合官方评测与模型定位来看,FireRedAudio 更偏向”音频理解 + 生成”一体化的应用,例如电商客服可用它把长时通话转写后再做要点问答,教育团队可把课程录音转成带克隆音色的精讲音频,因此适用人群覆盖内容创作者与音频应用开发者。

  • 智能音频助手:用语音问答 + 长音频理解做会议记录、播客要点提取与口语化问答
  • 多语种内容生产:ASR 转写配合语音克隆 / 编辑,做跨语种配音与有声内容二次创作
  • 语音编辑与修复:对已有录音做语义级插入 / 删除 / 替换,快速改稿无需重录

适用人群:音频应用开发者、播客与短视频创作者、做会议 / 客服语音分析的团队、需要语音克隆与编辑的内容工作室,以及研究统一音频建模的高校研究者。相比拼装多条流水线,单模型方案对中小团队更省运维。

如何使用 FireRedAudio

使用前的环境准备

  • 运行环境:Linux + Python 3.10 + PyTorch 2.1+,推理显存约 20GB 级(9B 档),需 CUDA 与 ffmpeg
  • 权重来源:需能访问 Hugging Face / ModelScope,用于下载 FireRedAudio 9B 权重

快速接入步骤

  1. 克隆仓库:执行 git clone https://github.com/FireRedTeam/FireRedAudio.git 进入项目根目录
  2. 安装依赖与权重:执行 pip install -r requirements.txt,从 Hugging Face / ModelScope 拉取 9B 权重
  3. 运行推理:参照 examples 目录下的 ASR、音频问答、克隆与编辑脚本分别体验
  4. 接入业务:把模型封装为本地服务,按 ASR / 问答 / 克隆 / 编辑四类接口接入应用

完整接口、示例与最新评测请参考 FireRedAudio 官方仓库

FireRedAudio 的价格与开源情况

FireRedAudio 以 Apache-2.0 协议开源,9B 权重与代码已在 GitHub、Hugging Face 与 ModelScope 开放,可免费用于研究、学习与商业集成,商用无授权费。

模型基于 Qwen3.5 架构,二次开发需保留许可证声明;需注意语音克隆功能官方声明仅限学术研究用途、禁止非法使用,商用落地前应确认参考音频的授权来源。官方未提供按量计费的托管 API,实际推理需自备算力。

FireRedAudio 常见问题

FireRedAudio 与 FireRedTTS3 有什么区别?

FireRedAudio 是统一音频语言模型,覆盖 ASR、音频问答、长音频理解、语音克隆与编辑等任务;FireRedTTS3 聚焦于语音生成与编辑,两者同属小红书 FireRed 团队、能力互补。

FireRedAudio 支持多长的音频理解?

官方披露支持约 1 小时长音频的上下文理解,适合会议、课程、播客等长内容处理,无需切片拼接。

语音克隆是否需要参考音频?

语音克隆任务需要清晰的目标音色参考音频;克隆效果建议参考音频与目标任务语种一致,以保证音色还原度。

FireRedAudio 能否商用?

Apache-2.0 允许商用,但涉及语音克隆与音色时建议评估授权与合规边界,避免侵权风险。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章