Muse Voice Transcribe是一款由 Meta 超级智能实验室于 2026 年 9 月推出的实时音频感知模型,在同一流程中整合流式语音识别、说话人分离与端点检测,可在 20 余名说话者的录音中分轨转写并自动判定说话结束边界,支持超过 1 小时的音频与句内语言切换。
| 基础信息 | 内容 |
|---|---|
| 开发团队 | Meta Superintelligence Labs(Meta 超级智能实验室) |
| 发布时间 | 2026 年 9 月 1 日 |
| 产品定位 | 实时音频感知模型(流式 ASR + 说话人分离 + 端点检测) |
| 模型系列 | Muse Spark 系列自回归多模态模型 |
| 处理方式 | 音频按 80 毫秒(12.5Hz)切片并转为软 token |
| 说话人支持 | 20 余名说话者分轨,无需后处理 |
| 音频长度 | 原生支持超过 1 小时的长音频 |
| 语言覆盖 | 训练覆盖 70 余种语言,发布时验证 25 种 |
| 关键评测 | Artificial Analysis 流式语音转文本排行榜第 1(截至 2026 年 9 月 1 日) |
| 定价 | 每 1000 分钟音频 3 美元,约合每小时 0.18 美元 |

Muse Voice Transcribe 的核心能力
与 FireRedAudio 等通用音频模型相比,Muse Voice Transcribe 最直接的差异是”三合一”:转写、说话人分离与端点检测都在同一个自回归模型里完成,而不是先转写、再跑一个分离模型、最后用规则判断一句话有没有说完。
一个解码循环里完成三件事
模型把音频按 80 毫秒(12.5Hz)切片,每片转为一个软 token;每一步解码,模型自行决定是继续听下一片,还是输出一个文本 token。说话人切换用专门的 token 标记、说话人标签延后到音频块末尾预测;语音起止同样用 token 标记。因此同一次调用就能同时产出文字、说话人归属与语句边界,不必再拼三个独立服务。
自适应延迟:把速度与准确度的取舍交给模型
- 逐词决策:模型为每个词判断需要多长的音频上下文才输出结果,简单词快速提交,难词多等一些上下文
- 强化学习训练:词错误率奖励与延迟奖励以乘法方式组合,而非常见的加法折中
- 帕累托前沿下移:官方称其在速度与准确度的权衡上优于此前的最优曲线,最终转写时间约 0.15 至 0.16 秒
- 说话人分离同步完成:平均分离错误率 17.5%,官方称优于 Artificial Analysis 榜单受测的全部离线与流式模型
在语言层面,模型训练覆盖 70 余种语言,其中 25 种在发布时完成验证,Meta 建议初始版本优先使用这 25 种;它原生支持句内与句间的语码转换,中英文夹杂的表达也能被识别。开发者还可通过语言、关键词与上下文偏置,在不做微调的前提下提升特定语言、术语或场景下的识别准确率。
Muse Voice Transcribe 与 Gemini 3.1 Flash Live 对比
Muse 是专门的实时音频感知模型,Gemini 3.1 Flash Live 是通用实时多模态对话模型(ASR 只是其输入能力之一)。以下对照基于 Meta 与 Google 官方公开信息及 Artificial Analysis 数据。
| 对比维度 | Muse Voice Transcribe(Meta) | Gemini 3.1 Flash Live(Google) |
|---|---|---|
| 产品定位 | 专门的实时音频感知与 ASR 模型 | 通用实时多模态对话模型,ASR 只是其输入能力之一 |
| 核心能力 | 流式 ASR、说话人分割、语音端点检测 | 实时双向语音对话(ASR + TTS)、多模态(音频 / 视频 / 图像 / 文本)、函数调用 |
| 词错误率 | AA-WER Streaming Index 3.1%,Artificial Analysis 排名第一 | 未公布具体 ASR WER 数值,主打低延迟流式 ASR 与对话流畅度 |
| 说话人分割 | 原生支持 20+ 位说话人,DER 仅 17.5% | 未明确支持多人说话人分割,专注单轮 / 双轮实时对话 |
| 延迟策略 | 自适应延迟,通过强化学习为每个单词动态调整等待时间 | Sub-200ms 固定首 token 延迟,追求极速响应 |
| 长音频处理 | 原生支持 1 小时+ 连续音频,无需分段 | 纯音频会话默认 15 分钟限制,需接入 session 续接机制 |
| 语码切换 | 原生支持句子内 / 间任意语码转换,精准识别中英文夹杂 | 支持 90+ 种语言,但未强调语码切换专项优化 |
| 纯转写成本 | $0.18 / 小时 | 音频输入 $0.30 / 小时 + 文本输出约 $0.07 / 小时,合计约 $0.37 / 小时 |
| 输出能力 | 仅文本转写 + 说话人标签(<|speaker_A|>) | 文本 + 音频合成(TTS)+ 工具调用 + 结构化输出 + 实时搜索 |
注:以上数据来自 Meta 官方发布信息、Google Gemini 官方说明及 Artificial Analysis 流式语音转文本榜单(截至 2026 年 9 月 1 日)。Muse 的 WER 与说话人分割 DER 均为 Artificial Analysis 独立评测结果。
从对照可以看出,两者定位不同:Muse 把流式转写、说话人分割与端点检测合并进一次调用,在长音频、说话人分割与语码切换上更专精;Gemini 3.1 Flash Live 胜在通用多模态与极低首 token 延迟,但 ASR 并非其唯一或主打能力。对会议转写、语音智能体这类需要高精度转写的场景,Muse 更对口。
Muse Voice Transcribe 的应用场景与适用人群
由于同时输出文字、说话人归属与语句边界,Muse Voice Transcribe 适合”多人、长时间、需要区分谁说了什么”的转写与交互场景。
- 会议与访谈转写:20 余名说话者分轨,配合 1 小时以上长音频支持,适合董事会、访谈与庭审记录
- 语音智能体与实时字幕:端点检测在模型内完成,系统能立刻判断用户说完没有,适合通话字幕与语音助手
- 听写与语音输入:已用于 Mac 版 Meta AI 的系统级听写与 Muse Code 的语音输入,按住 Fn 键即可对任意应用口述
适用人群:构建语音智能体与实时字幕的开发者、做会议记录与访谈转写的效率工具团队、需要多说话人分轨的客服与销售会话分析平台,以及希望用语音驱动编程会话的开发者。需要注意它是纯 API 托管的模型,音频不能出内网的场景暂不适用。
如何使用 Muse Voice Transcribe
接入前的准备
- 在 dev.meta.ai 申请 Meta Model API 的开发者访问权限并获取密钥
- 确认目标语言属于已验证的 25 种之一,其余语言建议先自行评测再上线
快速接入步骤
- 获取密钥:在 Meta Model API 控制台(模型说明见 Muse Voice Transcribe 官网)创建 API key,确认已开通 muse-voice-transcribe-1.0 模型
- 指向接口:把现有兼容 OpenAI SDK 的客户端指向 Meta Model API,即可沿用既有调用方式
- 流式送入音频:按流式方式持续输入音频流,模型会逐段输出带说话人归属的文本
- 配置偏置:针对专有名词与行业术语设置关键词与上下文偏置,无需微调即可提升识别准确率
完整的定价、快速上手指南与最新榜单数据请参考 Muse Voice Transcribe 官网。
Muse Voice Transcribe 的价格与开源情况
Muse Voice Transcribe 为闭源商业模型,不开放模型权重,只能通过 Meta Model API 调用。官方定价为每 1000 分钟音频 3 美元,约合每小时 0.18 美元,这一水平与 ElevenLabs、AssemblyAI 等流式转写服务的标准档位接近,并非以低价切入。
换句话说,它的卖点是准确度与架构简化,而不是最便宜。对原本就要为 ASR、说话人分离、端点检测分别付费的团队,合并成一次调用后的综合成本通常更低;此外,Mac 版 Meta AI 的系统级听写与 Muse Code 的语音输入已内置该模型。
Muse Voice Transcribe 常见问题
Muse Voice Transcribe 与其他转写 API 最大的区别是什么?
它把流式语音识别、说话人分离与端点检测整合在同一个自回归模型里,一次调用即可输出文字、说话人归属与语句边界;多数流式转写服务需要分别调用 ASR 与说话人分离模块,再做后处理。
Muse Voice Transcribe 支持多少种语言?
模型训练覆盖 70 余种语言,其中 25 种在发布时完成验证,Meta 建议初始版本优先使用已验证的 25 种;它原生支持句内与句间的语码转换,中英文夹杂也能识别。
它的定价是多少?
官方定价为每 1000 分钟音频 3 美元,约合每小时 0.18 美元,模型名为 muse-voice-transcribe-1.0,只能经由 Meta Model API 调用,不开放模型权重。
Muse Voice Transcribe 能离线或在本地部署吗?
不能。它是托管在 Meta Model API 上的模型,不提供离线或端侧部署方案;如果音频不能离开自有基础设施,需要另行考虑本地优先的转写方案。
浙公网安备33010202004812号