MAI-Transcribe-2-Streaming是一款由微软于2026年10月推出的实时流式语音转写模型,主要用于把讲话过程中的语音持续转为文字,支持 60 种语言与自动连续语言检测,适用于实时字幕、客服智能体与语音助手等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 实时流式语音转写模型 |
| 出品方 | 微软人工智能(Microsoft AI) |
| 发布时间 | 2026年10月1日 |
| 语言支持 | 60 种,自动检测语言变化 |
| 最终词错误率 | 2.50% |
| 最终转录延迟 | 0.13 秒 |
| 首批部分文本 | 约 100 至 320 毫秒 |
| 优惠价格 | 每音频小时 0.54 美元 |
| 接入渠道 | Microsoft Foundry、OpenRouter |
| 开源情况 | 闭源,仅提供 API 调用 |

MAI-Transcribe-2-Streaming 的核心能力
微软把 MAI-Transcribe-2-Streaming 定位为面向语音智能体的实时输入层。与以往「先录完再转写」的批处理方式不同,该模型在讲话进行中就开始产出文本,这一变化直接影响 AI模型 接入语音的场景边界:语音应用不必等用户说完一句,就能提前理解意图并准备后续动作。
讲话进行中持续输出文字
MAI-Transcribe-2-Streaming 在接收音频后约 100 多毫秒内生成首批「部分文本」,随后依据更多上下文持续修正,并在语句结束后快速提交稳定结果。微软称,在其内部实时评估中,文字最快可在语音出现后约 320 毫秒显示。模型通过 WebSocket 接收音频流并按片段持续回传。
准确率与延迟两项指标同时靠前
在 Artificial Analysis 的流式语音转文字评测中,该模型的最终词错误率为 2.50%、最终转录延迟为 0.13 秒,两项均列第一;首次部分转录的词错误率为 2.8%。同一轮评测中,其表现优于此前的领先者:Grok Voice Transcribe 2.0 Streaming 的最终词错误率为 2.73%,延迟约 0.49 秒。微软同时说明,该模型在准确率与延迟的权衡曲线上处于前沿位置。
60 种语言与自动连续语言检测
模型覆盖 60 种语言,并具备自动、连续的语言检测能力。使用方无需在会话开始前指定语言,系统会根据语音内容识别语言变化。对多语种客服与跨地区会议而言,这一点省去了按语种分段重建会话的步骤,转写结果可以保持单条会话的连续性。
与两款语音合成模型配套组合
与流式转写同期发布的还有文本转语音模型 MAI-Voice-2.1 与 MAI-Voice-2.1-Flash,分别面向表现力与低延迟两类需求,各支持 23 种语言,定价分别为每百万字符 22 美元与 15 美元。两者均支持在受支持语言之间保持同一音色切换语种,并内置同意校验机制:声音复刻需经过审核与授权,只有获得本人同意的声音才可合成。
云端接入与替换成本
模型通过 Microsoft Foundry、MAI Playground 与 OpenRouter 提供,语音应用可以直接替换原有转写环节。对已在使用微软语音服务的团队,改动集中在模型标识与流式会话的拼接逻辑上,上层业务链路无需重建。
MAI-Transcribe-2-Streaming 与同类语音转写模型的对比
| 对比维度 | MAI-Transcribe-2-Streaming | Confucius4-R2T2 | Grok Voice Transcribe 2.0 |
|---|---|---|---|
| 开发方 | 微软 | 网易有道 | xAI |
| 发布时间 | 2026年10月1日 | 2026年9月16日 | 2026年9月18日 |
| 产品定位 | 实时流式语音转写模型 | 真流式语音识别模型 | 高精度实时语音转写模型 |
| 流式输出机制 | 持续修正,语句结束提交稳定结果 | 真流式 append-only,已输出文本不再改写 | 批量与流式两种形态 |
| 首次结果延迟 | 约 100 至 320 毫秒 | 解码块 80 毫秒至 2 秒可配置 | 官方未公布 |
| 随附能力 | 自动、连续的语言检测 | 上下文与热词提示 | 词级时间戳、说话人分离 |
| 音频定价 | 每音频小时 0.54 美元(优惠期) | 开源权重,自行部署 | 每音频小时 0.20 美元(流式) |
| 开源情况 | 闭源,仅提供 API 调用 | 权重开放(网易模型许可) | 闭源商用模型 |
上表 MAI-Transcribe-2-Streaming 一列取自微软官方发布材料,Confucius4-R2T2 一列取自网易有道官方仓库说明,Grok Voice Transcribe 2.0 一列取自 xAI 官方模型说明。差异集中在形态与成本:MAI-Transcribe-2-Streaming 与 Grok Voice Transcribe 2.0 都以云端接口按音频小时计费,前者优惠期单价比后者高出约一倍半,换取更低的最终延迟;Confucius4-R2T2 以约 20 亿参数的开放权重提供本地部署路径,解码块可在 80 毫秒至 2 秒之间配置,代价是规模化服务需自行承担。
如果需要按录音文件批量转写并压低单位成本,可以参考 MAI-Transcribe-2(微软上一代非流式语音转写模型,按音频小时 0.10 美元计费,适合会议记录与临床文书等完整转写任务)。
MAI-Transcribe-2-Streaming 的应用场景与适用人群
该模型面向需要边听边处理的实时语音链路,常见场景包括:
- 实时字幕:直播、线上会议与课堂中同步生成字幕,延迟指标直接决定字幕的可读性。
- 客服智能体:在来电者尚未说完时开始识别问题并预取业务数据,缩短单次应答时长。
- 语音助手:把语音输入前置到推理环节,先启动工具调用准备,语句结束后再确认执行。
- 多语种会话记录:依赖自动语言检测处理语种切换频繁的跨地区会议记录。
适用人群:构建实时语音交互产品的开发者、需要低延迟字幕能力的直播与教育平台,以及把语音入口接入智能体流程的企业团队。对只需要处理录音文件的场景,非流式模型在成本上更合适。
MAI-Transcribe-2-Streaming 的使用方法
模型通过云端接口提供,按以下顺序接入:
- 核对能力边界:在 MAI-Transcribe-2-Streaming 官方发布页 中确认支持语言与延迟口径。
- 开通渠道:通过 Microsoft Foundry 或 OpenRouter 获取调用凭据,也可先在 MAI Playground 中体验效果。
- 建立流式会话:以
WebSocket持续推送音频片段,接收增量返回的部分文本。 - 处理最终结果:语句结束标记到达后,以稳定文本覆盖此前的部分结果,再交给下游逻辑。
- 设置降级路径:在网络抖动或超时场景下切换回批量转写接口,避免会话中断。
接入初期建议先用单向音频流验证延迟与断句表现,再叠加工具调用与业务逻辑。
MAI-Transcribe-2-Streaming 的价格与开源情况
MAI-Transcribe-2-Streaming 的优惠期定价为每音频小时 0.54 美元,约合每 1,000 分钟 9 美元,优惠持续至 2026 年底,此后将恢复常规定价。同批发布的 MAI-Voice-2.1 与 MAI-Voice-2.1-Flash 分别按每百万字符 22 美元与 15 美元计费。对以流式转写为核心链路的语音产品,音频小时单价需要与延迟指标一并权衡:单位成本更高的前提是延迟改善能转化为业务收益。
MAI-Transcribe-2-Streaming 未开放模型权重,属于闭源模型,仅通过微软云平台与合作渠道提供 API 调用,本地部署与私有化方案不在可选范围内。需要本地化处理的场景,只能选择权重开放的同类模型。
MAI-Transcribe-2-Streaming 的常见问题
MAI-Transcribe-2-Streaming 与 MAI-Transcribe-2 有什么区别?
MAI-Transcribe-2-Streaming 是流式版本,在讲话进行中持续输出并修正文本,适合实时对话与字幕;MAI-Transcribe-2 是非流式版本,处理完成后一次性返回结果,适合录音文件、会议记录与临床文书等完整转写任务,单位成本也更低。
MAI-Transcribe-2-Streaming 支持哪些语言?
模型覆盖 60 种语言,并具备自动、连续的语言检测能力。使用方无需在会话开始前手动指定语言,系统会随语音内容识别语言变化,适合语种切换频繁的多语种会话场景。
MAI-Transcribe-2-Streaming 怎么收费?
优惠期定价为每音频小时 0.54 美元,约合每 1,000 分钟 9 美元,优惠持续至 2026 年底。模型为闭源,仅通过 Microsoft Foundry、MAI Playground 等渠道提供接口调用。
浙公网安备33010202004812号