MAI-Transcribe-2是一款由微软推出的AI语音转写模型,主要用于将会议录音、访谈、播客、视频音频等高精度转为文字,支持 60 种语言与自然混语识别,适用于批量、低成本、高准确率的转写场景,2026 年 9 月 3 日发布。
| 基础信息 | 内容 |
|---|---|
| 开发厂商 | 微软(Microsoft AI 团队) |
| 模型类型 | AI 语音转写 / 语音识别(Speech-to-Text) |
| 发布时间 | 2026 年 9 月 3 日 |
| 支持语言 | 60 种语言,支持自动语言识别与混语 |
| 核心指标 | FLEURS 60 语言平均词错误率(WER)5.2% |
| 推理速度 | 1 小时音频约 10 秒返回 |
| 计费方式 | 限时 $0.10 / 小时音频(至 2026 年底) |
| 开源情况 | 闭源商业模型,不支持本地自部署 |
| 调用平台 | Microsoft Foundry、MAI Playground、OpenRouter |

MAI-Transcribe-2 的核心能力
多语种高精度转写
MAI-Transcribe-2 在 FLEURS 60 语言基准上平均词错误率(WER)仅 5.2%,Top 25 语言低至 3.4%,单模型覆盖 60 种语言。它把工程投入全压在语音转写这一垂直场景上,而非追逐通用能力,以更低成本换取更高的准确率与吞吐。
说话人分离与逐词时间戳
说话人分离(diarization)能区分不同发言者并把文字归属到对应说话人;逐词时间戳(word-level timestamps)为每个词标注精确位置,便于检索、导航与字幕对齐。
verbatim 与 clean 双模式转写
转写风格提供 verbatim 与 clean 两种模式:verbatim 保留语气词与口误,面向合规与分析;clean 去除语气词并自动格式化,产出易读的字幕、笔记与发布文本。
关键词偏置与自动混语识别
关键词偏置(keyword biasing)帮助模型识别领域术语、缩写与专有名词;自动语言识别与混语支持(如 Hinglish、Spanglish)无需预先指定语言即可处理多语种切换,在背景噪声下也能保持转写质量。
MAI-Transcribe-2 与同类模型的对比
以下把 MAI-Transcribe-2 与同类的语音转写/语音识别模型对比:选 Gemini 3.5 Transcribe(谷歌)、Whisper v3-Large(OpenAI)与 FunASR(阿里达摩院)。FLEURS 数据来自微软 2026-09-03 官方博文,词错误率越低越好。
| 对比维度 | MAI-Transcribe-2 | Gemini 3.5 Transcribe | Whisper v3-Large | FunASR |
|---|---|---|---|---|
| 开发方 | 微软 | 谷歌 | OpenAI | 阿里达摩院 |
| 产品定位 | 语音转写模型 | 语音转文本与自动整理模型 | 开源语音转写模型 | 开源语音识别工具包 |
| FLEURS 平均 WER | 5.2% | 未公布同口径 | 22.8% | 未公布同口径 |
| 支持语言 | 60 种 | 85 种以上 | 约 100 种 | 以中文为主 |
| 说话人分离 | 支持 | 支持(最多 3 人) | 不支持 | 支持 |
| 开源程度 | 闭源 | 闭源 | 开源(MIT) | 开源 |
| 计费参考 | $0.10/小时(限时) | 公开预览免费 | 免费开源 | 免费开源本地部署 |
注:MAI-Transcribe-2 的 FLEURS 平均 WER 5.2% 与 Whisper v3-Large 的 22.8% 引自微软 2026-09-03 官方博文;Gemini 3.5 Transcribe 公开预览未给出 FLEURS 同口径数值,FunASR 面向中文场景无 FLEURS 数据,故两格标「未公布同口径」。
从官方数据可以看出,MAI-Transcribe-2 在同类别语音转写模型里,准确率(FLEURS WER 5.2%)明显优于开源的 Whisper v3-Large(22.8%),且以 $0.10/小时的限时价提供托管 API,兼顾精度与成本;较开源方案,它的优势在免自建算力与工程。
如果想了解国产开源音频模型作为对照,可参考 FireRedAudio(小红书 FireRed 团队推出的通用音频语言模型,Apache-2.0 开源、9B 权重可本地部署)。
MAI-Transcribe-2 的应用场景与适用人群
MAI-Transcribe-2 在以下场景具备直接价值:
- 会议与访谈记录:自动区分发言者并生成带时间戳的文字稿,便于会后检索、归档与要点提炼。
- 字幕与无障碍:clean 模式产出易读字幕,支持播客、视频、直播的多语种字幕与无障碍转写。
- 医疗与法律文档:verbatim 模式保留原话,满足临床记录、法务笔录等强合规留痕需求。
适用人群:MAI-Transcribe-2 适合处理大量语音内容的团队与个人,包括媒体剪辑与字幕组、企业会议记录岗、医疗与法律等强合规行业,以及构建语音 Agent、客服分析的研发团队;对追求低成本高吞吐的开发者,它能以单一模型替代多套语种识别方案。
如何使用 MAI-Transcribe-2
MAI-Transcribe-2 通过 Microsoft Foundry(Azure Speech 公开预览)、MAI Playground 与 OpenRouter 三个入口开放调用,最常用 Azure 的 Fast Transcription API:
- 开通资源:需 Azure 订阅并创建 Microsoft Foundry 语音资源,获取密钥与端点,参数见 MAI-Transcribe-2 官网。
- 选择模型:调用 Fast Transcription API 时启用 enhanced 模式,把 model 属性指定为 MAI-Transcribe-2。
- 提交音频:上传不超过 300 MB 的 WAV/MP3/FLAC 文件,按需开启说话人分离、逐词时间戳与关键词偏置。
- 获取结果:接口返回带说话人标签与时间戳的文本,也可在 MAI Playground 试听、校对与导出。
MAI-Transcribe-2 的价格与开源情况
MAI-Transcribe-2 上市时限时计费 $0.10/小时音频,优惠至 2026 年底。上一代 MAI-Transcribe-1.5 为 $0.36/小时,二代新增说话人分离等能力的同时把单价压低近 70%;2027 年定价尚未公布。
在语音转写这一垂直赛道上,价格与吞吐仍是开发者最敏感的指标:开源方案虽免费但需自建算力与工程,MAI-Transcribe-2 的 $0.10/小时托管价则在精度与成本之间取得了更直接的平衡。
开源方面,MAI-Transcribe-2 是闭源商业模型,未开放权重,不支持本地自部署,与 Whisper 等开源方案形成差异;若必须私有化部署,仍需选择可自托管模型。注意 Azure Speech 上当前为公开预览(无 SLA),不建议承载生产负载。
MAI-Transcribe-2 常见问题
MAI-Transcribe-2 支持哪些语言?
支持 60 种语言,具备自动语言识别与混语(code-switching)能力,如 Hinglish、Spanglish 等无需预先指定语言,模型自动检测录音语言。
MAI-Transcribe-2 与 Whisper 相比有什么优势?
在 FLEURS 60 语言基准上,MAI-Transcribe-2 平均 WER 仅 5.2%,远低于 Whisper v3-Large 的 22.8%;同时内置说话人分离与逐词时间戳,Whisper 需额外工程补齐。
如何调用 MAI-Transcribe-2?
可通过 Microsoft Foundry(Azure Speech 公开预览)、MAI Playground 与 OpenRouter 调用;音频需小于 300 MB,支持 WAV、MP3、FLAC,并在 Fast Transcription API 的 enhanced 模式指定模型。
MAI-Transcribe-2 免费或开源吗?
它是闭源商业模型,未开源、不支持本地部署;当前限时计费 $0.10/小时音频,优惠至 2026 年底,2027 年定价尚未公布。
verbatim 与 clean 模式有什么区别?
verbatim 保留语气词、口误与停顿,适合合规留痕与分析;clean 去除语气词并自动格式化,产出更易读的字幕、笔记与发布文本。
浙公网安备33010202004812号