MAI-Transcribe-2 – 微软推出的AI语音转写模型

AI模型3天前更新 智小研
26 0

MAI-Transcribe-2是一款由微软推出的AI语音转写模型,主要用于将会议录音、访谈、播客、视频音频等高精度转为文字,支持 60 种语言与自然混语识别,适用于批量、低成本、高准确率的转写场景,2026 年 9 月 3 日发布。

基础信息内容
开发厂商微软(Microsoft AI 团队)
模型类型AI 语音转写 / 语音识别(Speech-to-Text)
发布时间2026 年 9 月 3 日
支持语言60 种语言,支持自动语言识别与混语
核心指标FLEURS 60 语言平均词错误率(WER)5.2%
推理速度1 小时音频约 10 秒返回
计费方式限时 $0.10 / 小时音频(至 2026 年底)
开源情况闭源商业模型,不支持本地自部署
调用平台Microsoft Foundry、MAI Playground、OpenRouter
MAI-Transcribe-2 – 微软推出的AI语音转写模型

MAI-Transcribe-2 的核心能力

多语种高精度转写

MAI-Transcribe-2 在 FLEURS 60 语言基准上平均词错误率(WER)仅 5.2%,Top 25 语言低至 3.4%,单模型覆盖 60 种语言。它把工程投入全压在语音转写这一垂直场景上,而非追逐通用能力,以更低成本换取更高的准确率与吞吐。

说话人分离与逐词时间戳

说话人分离(diarization)能区分不同发言者并把文字归属到对应说话人;逐词时间戳(word-level timestamps)为每个词标注精确位置,便于检索、导航与字幕对齐。

verbatim 与 clean 双模式转写

转写风格提供 verbatim 与 clean 两种模式:verbatim 保留语气词与口误,面向合规与分析;clean 去除语气词并自动格式化,产出易读的字幕、笔记与发布文本。

关键词偏置与自动混语识别

关键词偏置(keyword biasing)帮助模型识别领域术语、缩写与专有名词;自动语言识别与混语支持(如 Hinglish、Spanglish)无需预先指定语言即可处理多语种切换,在背景噪声下也能保持转写质量。

MAI-Transcribe-2 与同类模型的对比

以下把 MAI-Transcribe-2 与同类的语音转写/语音识别模型对比:选 Gemini 3.5 Transcribe(谷歌)、Whisper v3-Large(OpenAI)与 FunASR(阿里达摩院)。FLEURS 数据来自微软 2026-09-03 官方博文,词错误率越低越好。

对比维度MAI-Transcribe-2Gemini 3.5 TranscribeWhisper v3-LargeFunASR
开发方微软谷歌OpenAI阿里达摩院
产品定位语音转写模型语音转文本与自动整理模型开源语音转写模型开源语音识别工具包
FLEURS 平均 WER5.2%未公布同口径22.8%未公布同口径
支持语言60 种85 种以上约 100 种以中文为主
说话人分离支持支持(最多 3 人)不支持支持
开源程度闭源闭源开源(MIT)开源
计费参考$0.10/小时(限时)公开预览免费免费开源免费开源本地部署

注:MAI-Transcribe-2 的 FLEURS 平均 WER 5.2% 与 Whisper v3-Large 的 22.8% 引自微软 2026-09-03 官方博文;Gemini 3.5 Transcribe 公开预览未给出 FLEURS 同口径数值,FunASR 面向中文场景无 FLEURS 数据,故两格标「未公布同口径」。

从官方数据可以看出,MAI-Transcribe-2 在同类别语音转写模型里,准确率(FLEURS WER 5.2%)明显优于开源的 Whisper v3-Large(22.8%),且以 $0.10/小时的限时价提供托管 API,兼顾精度与成本;较开源方案,它的优势在免自建算力与工程。

如果想了解国产开源音频模型作为对照,可参考 FireRedAudio(小红书 FireRed 团队推出的通用音频语言模型,Apache-2.0 开源、9B 权重可本地部署)。

MAI-Transcribe-2 的应用场景与适用人群

MAI-Transcribe-2 在以下场景具备直接价值:

  • 会议与访谈记录:自动区分发言者并生成带时间戳的文字稿,便于会后检索、归档与要点提炼。
  • 字幕与无障碍:clean 模式产出易读字幕,支持播客、视频、直播的多语种字幕与无障碍转写。
  • 医疗与法律文档:verbatim 模式保留原话,满足临床记录、法务笔录等强合规留痕需求。

适用人群:MAI-Transcribe-2 适合处理大量语音内容的团队与个人,包括媒体剪辑与字幕组、企业会议记录岗、医疗与法律等强合规行业,以及构建语音 Agent、客服分析的研发团队;对追求低成本高吞吐的开发者,它能以单一模型替代多套语种识别方案。

如何使用 MAI-Transcribe-2

MAI-Transcribe-2 通过 Microsoft Foundry(Azure Speech 公开预览)、MAI Playground 与 OpenRouter 三个入口开放调用,最常用 Azure 的 Fast Transcription API:

  1. 开通资源:需 Azure 订阅并创建 Microsoft Foundry 语音资源,获取密钥与端点,参数见 MAI-Transcribe-2 官网
  2. 选择模型:调用 Fast Transcription API 时启用 enhanced 模式,把 model 属性指定为 MAI-Transcribe-2。
  3. 提交音频:上传不超过 300 MB 的 WAV/MP3/FLAC 文件,按需开启说话人分离、逐词时间戳与关键词偏置。
  4. 获取结果:接口返回带说话人标签与时间戳的文本,也可在 MAI Playground 试听、校对与导出。

MAI-Transcribe-2 的价格与开源情况

MAI-Transcribe-2 上市时限时计费 $0.10/小时音频,优惠至 2026 年底。上一代 MAI-Transcribe-1.5 为 $0.36/小时,二代新增说话人分离等能力的同时把单价压低近 70%;2027 年定价尚未公布。

在语音转写这一垂直赛道上,价格与吞吐仍是开发者最敏感的指标:开源方案虽免费但需自建算力与工程,MAI-Transcribe-2 的 $0.10/小时托管价则在精度与成本之间取得了更直接的平衡。

开源方面,MAI-Transcribe-2 是闭源商业模型,未开放权重,不支持本地自部署,与 Whisper 等开源方案形成差异;若必须私有化部署,仍需选择可自托管模型。注意 Azure Speech 上当前为公开预览(无 SLA),不建议承载生产负载。

MAI-Transcribe-2 常见问题

MAI-Transcribe-2 支持哪些语言?

支持 60 种语言,具备自动语言识别与混语(code-switching)能力,如 Hinglish、Spanglish 等无需预先指定语言,模型自动检测录音语言。

MAI-Transcribe-2 与 Whisper 相比有什么优势?

在 FLEURS 60 语言基准上,MAI-Transcribe-2 平均 WER 仅 5.2%,远低于 Whisper v3-Large 的 22.8%;同时内置说话人分离与逐词时间戳,Whisper 需额外工程补齐。

如何调用 MAI-Transcribe-2?

可通过 Microsoft Foundry(Azure Speech 公开预览)、MAI Playground 与 OpenRouter 调用;音频需小于 300 MB,支持 WAV、MP3、FLAC,并在 Fast Transcription API 的 enhanced 模式指定模型。

MAI-Transcribe-2 免费或开源吗?

它是闭源商业模型,未开源、不支持本地部署;当前限时计费 $0.10/小时音频,优惠至 2026 年底,2027 年定价尚未公布。

verbatim 与 clean 模式有什么区别?

verbatim 保留语气词、口误与停顿,适合合规留痕与分析;clean 去除语气词并自动格式化,产出更易读的字幕、笔记与发布文本。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章