Muse Voice Transcribe – Meta推出的实时音频感知与流式语音转写模型

AI模型4天前更新 智小研
31 0

Muse Voice Transcribe是一款由 Meta 超级智能实验室于 2026 年 9 月推出的实时音频感知模型,在同一流程中整合流式语音识别、说话人分离与端点检测,可在 20 余名说话者的录音中分轨转写并自动判定说话结束边界,支持超过 1 小时的音频与句内语言切换。

基础信息内容
开发团队Meta Superintelligence Labs(Meta 超级智能实验室)
发布时间2026 年 9 月 1 日
产品定位实时音频感知模型(流式 ASR + 说话人分离 + 端点检测)
模型系列Muse Spark 系列自回归多模态模型
处理方式音频按 80 毫秒(12.5Hz)切片并转为软 token
说话人支持20 余名说话者分轨,无需后处理
音频长度原生支持超过 1 小时的长音频
语言覆盖训练覆盖 70 余种语言,发布时验证 25 种
关键评测Artificial Analysis 流式语音转文本排行榜第 1(截至 2026 年 9 月 1 日)
定价每 1000 分钟音频 3 美元,约合每小时 0.18 美元
Muse Voice Transcribe – Meta推出的实时音频感知与流式语音转写模型

Muse Voice Transcribe 的核心能力

FireRedAudio 等通用音频模型相比,Muse Voice Transcribe 最直接的差异是”三合一”:转写、说话人分离与端点检测都在同一个自回归模型里完成,而不是先转写、再跑一个分离模型、最后用规则判断一句话有没有说完。

一个解码循环里完成三件事

模型把音频按 80 毫秒(12.5Hz)切片,每片转为一个软 token;每一步解码,模型自行决定是继续听下一片,还是输出一个文本 token。说话人切换用专门的 token 标记、说话人标签延后到音频块末尾预测;语音起止同样用 token 标记。因此同一次调用就能同时产出文字、说话人归属与语句边界,不必再拼三个独立服务。

自适应延迟:把速度与准确度的取舍交给模型

  • 逐词决策:模型为每个词判断需要多长的音频上下文才输出结果,简单词快速提交,难词多等一些上下文
  • 强化学习训练:词错误率奖励与延迟奖励以乘法方式组合,而非常见的加法折中
  • 帕累托前沿下移:官方称其在速度与准确度的权衡上优于此前的最优曲线,最终转写时间约 0.15 至 0.16 秒
  • 说话人分离同步完成:平均分离错误率 17.5%,官方称优于 Artificial Analysis 榜单受测的全部离线与流式模型

在语言层面,模型训练覆盖 70 余种语言,其中 25 种在发布时完成验证,Meta 建议初始版本优先使用这 25 种;它原生支持句内与句间的语码转换,中英文夹杂的表达也能被识别。开发者还可通过语言、关键词与上下文偏置,在不做微调的前提下提升特定语言、术语或场景下的识别准确率。

Muse Voice Transcribe 与 Gemini 3.1 Flash Live 对比

Muse 是专门的实时音频感知模型,Gemini 3.1 Flash Live 是通用实时多模态对话模型(ASR 只是其输入能力之一)。以下对照基于 Meta 与 Google 官方公开信息及 Artificial Analysis 数据。

对比维度Muse Voice Transcribe(Meta)Gemini 3.1 Flash Live(Google)
产品定位专门的实时音频感知与 ASR 模型通用实时多模态对话模型,ASR 只是其输入能力之一
核心能力流式 ASR、说话人分割、语音端点检测实时双向语音对话(ASR + TTS)、多模态(音频 / 视频 / 图像 / 文本)、函数调用
词错误率AA-WER Streaming Index 3.1%,Artificial Analysis 排名第一未公布具体 ASR WER 数值,主打低延迟流式 ASR 与对话流畅度
说话人分割原生支持 20+ 位说话人,DER 仅 17.5%未明确支持多人说话人分割,专注单轮 / 双轮实时对话
延迟策略自适应延迟,通过强化学习为每个单词动态调整等待时间Sub-200ms 固定首 token 延迟,追求极速响应
长音频处理原生支持 1 小时+ 连续音频,无需分段纯音频会话默认 15 分钟限制,需接入 session 续接机制
语码切换原生支持句子内 / 间任意语码转换,精准识别中英文夹杂支持 90+ 种语言,但未强调语码切换专项优化
纯转写成本$0.18 / 小时音频输入 $0.30 / 小时 + 文本输出约 $0.07 / 小时,合计约 $0.37 / 小时
输出能力仅文本转写 + 说话人标签(<|speaker_A|>)文本 + 音频合成(TTS)+ 工具调用 + 结构化输出 + 实时搜索

注:以上数据来自 Meta 官方发布信息、Google Gemini 官方说明及 Artificial Analysis 流式语音转文本榜单(截至 2026 年 9 月 1 日)。Muse 的 WER 与说话人分割 DER 均为 Artificial Analysis 独立评测结果。

从对照可以看出,两者定位不同:Muse 把流式转写、说话人分割与端点检测合并进一次调用,在长音频、说话人分割与语码切换上更专精;Gemini 3.1 Flash Live 胜在通用多模态与极低首 token 延迟,但 ASR 并非其唯一或主打能力。对会议转写、语音智能体这类需要高精度转写的场景,Muse 更对口。

Muse Voice Transcribe 的应用场景与适用人群

由于同时输出文字、说话人归属与语句边界,Muse Voice Transcribe 适合”多人、长时间、需要区分谁说了什么”的转写与交互场景。

  • 会议与访谈转写:20 余名说话者分轨,配合 1 小时以上长音频支持,适合董事会、访谈与庭审记录
  • 语音智能体与实时字幕:端点检测在模型内完成,系统能立刻判断用户说完没有,适合通话字幕与语音助手
  • 听写与语音输入:已用于 Mac 版 Meta AI 的系统级听写与 Muse Code 的语音输入,按住 Fn 键即可对任意应用口述

适用人群:构建语音智能体与实时字幕的开发者、做会议记录与访谈转写的效率工具团队、需要多说话人分轨的客服与销售会话分析平台,以及希望用语音驱动编程会话的开发者。需要注意它是纯 API 托管的模型,音频不能出内网的场景暂不适用。

如何使用 Muse Voice Transcribe

接入前的准备

  • 在 dev.meta.ai 申请 Meta Model API 的开发者访问权限并获取密钥
  • 确认目标语言属于已验证的 25 种之一,其余语言建议先自行评测再上线

快速接入步骤

  1. 获取密钥:在 Meta Model API 控制台(模型说明见 Muse Voice Transcribe 官网)创建 API key,确认已开通 muse-voice-transcribe-1.0 模型
  2. 指向接口:把现有兼容 OpenAI SDK 的客户端指向 Meta Model API,即可沿用既有调用方式
  3. 流式送入音频:按流式方式持续输入音频流,模型会逐段输出带说话人归属的文本
  4. 配置偏置:针对专有名词与行业术语设置关键词与上下文偏置,无需微调即可提升识别准确率

完整的定价、快速上手指南与最新榜单数据请参考 Muse Voice Transcribe 官网。

Muse Voice Transcribe 的价格与开源情况

Muse Voice Transcribe 为闭源商业模型,不开放模型权重,只能通过 Meta Model API 调用。官方定价为每 1000 分钟音频 3 美元,约合每小时 0.18 美元,这一水平与 ElevenLabs、AssemblyAI 等流式转写服务的标准档位接近,并非以低价切入。

换句话说,它的卖点是准确度与架构简化,而不是最便宜。对原本就要为 ASR、说话人分离、端点检测分别付费的团队,合并成一次调用后的综合成本通常更低;此外,Mac 版 Meta AI 的系统级听写与 Muse Code 的语音输入已内置该模型。

Muse Voice Transcribe 常见问题

Muse Voice Transcribe 与其他转写 API 最大的区别是什么?

它把流式语音识别、说话人分离与端点检测整合在同一个自回归模型里,一次调用即可输出文字、说话人归属与语句边界;多数流式转写服务需要分别调用 ASR 与说话人分离模块,再做后处理。

Muse Voice Transcribe 支持多少种语言?

模型训练覆盖 70 余种语言,其中 25 种在发布时完成验证,Meta 建议初始版本优先使用已验证的 25 种;它原生支持句内与句间的语码转换,中英文夹杂也能识别。

它的定价是多少?

官方定价为每 1000 分钟音频 3 美元,约合每小时 0.18 美元,模型名为 muse-voice-transcribe-1.0,只能经由 Meta Model API 调用,不开放模型权重。

Muse Voice Transcribe 能离线或在本地部署吗?

不能。它是托管在 Meta Model API 上的模型,不提供离线或端侧部署方案;如果音频不能离开自有基础设施,需要另行考虑本地优先的转写方案。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章