Grok Voice Transcribe 2.0是一款由xAI于2026年9月推出的实时语音转写模型,主要用于电话客服、会议记录与多语言音频的批量与流式转写,支持词级时间戳与置信度、说话人分离、最多 8 声道与每请求 100 个关键术语偏置,适用于客服质检、内容字幕与语音智能体等场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 实时语音转写(Speech-to-Text)模型 |
| 出品方 | xAI |
| 发布时间 | 2026年9月18日 |
| 底层基座 | Grok Voice 音频基础模型 |
| 转写形态 | 批量(文件与 URL)与流式 |
| 批量价格 | 0.10 美元 / 音频小时 |
| 流式价格 | 0.20 美元 / 音频小时 |
| 随附能力 | 词级时间戳、说话人分离、术语偏置 |
| 声道与术语 | 最多 8 声道、每请求 100 个术语 |
| 模型编码 | grok-voice-transcribe-2.0 |
| 接入方式 | xAI Speech-to-Text API(api.x.ai) |
| 开源情况 | 闭源商用模型,不提供本地部署 |

Grok Voice Transcribe 2.0 的核心能力
这款模型面向真实环境里的「难录音」。作为 AI 大模型 中竞争最直接的垂直品类之一,转写差距很少出现在录音棚,而是集中在电话线路、多人交替与专有名词密集的音频上。
四组内部评测的词错率同步下降
xAI 用四组来自生产流量的内部评测集衡量词错误率:客服电话音频(8 kHz 英语)、与 Grok 的对话、口述凭证(账号、邮箱与地址),以及 19 种语言的语音助手短句。四项相比上一代全部下降,跌幅最大的是多语言短句,也对应官方所说的「最大的提升来自多语言」。
Artificial Analysis 流式榜单的准确率位置
在公开的 Artificial Analysis 排行榜上,该模型在 32 个流式转写模型中准确率排名第一。官方还给出「准确率—价格」散点:横轴每千分钟单价、纵轴词错误率,越靠右上越优。要在自有音频上复现该结论,建议用同一批真实录音分别跑 1.0 与 2.0,比较错字分布而不是只看总分。
说话人分离、时间戳与术语偏置
这些配置项不额外收费:每个词都有起止时间与置信度;说话人分离为每位发言者打标签;最多 8 声道独立转写;每次请求可注入 100 个领域术语,用于产品名与医学术语;数字、日期、货币与邮箱地址统一转成书面形式,填充词可自动剔除。语音智能体还可开启智能轮次检测判断发言结束。
多语言与自动语言检测
模型可转写数十种语言,自动检测语种,并在单次处理中跟随录音中途的语言切换。官方短句评测覆盖 19 种语言,给出 6.8% 的词错误率。
Atlassian Loom 的规模化落地
Atlassian 已把该模型用于 Loom 的全部视频转写,理由是比原有方案更准确。由此串起的工作流颇有代表性:在 Loom 里录下行动方案,转写文本直接进入 Cursor 生成代码改动——录制即交付。
Grok Voice Transcribe 2.0 与同类语音转写模型的对比
转写能力的真实差距要看生产环境音频。以下对比数值取自 xAI 官方发布材料的内部评测图表,四组数据集均来自生产流量抽样。
| 对比维度 | Grok Voice Transcribe 2.0 | Grok Voice Transcribe 1.0 | Gemini 3.5 Transcribe | MAI-Transcribe-2 |
|---|---|---|---|---|
| 开发方 | xAI | xAI | 谷歌 | 微软 |
| 客服电话 WER | 7.1% | 10.6% | 15.9% | 9.3% |
| 对话 WER | 3.3% | 8.7% | 5.7% | 7.0% |
| 口述凭证 WER | 3.2% | 7.2% | 10.4% | 2.6% |
| 多语言短句 WER | 6.8% | 20.6% | 7.8% | 7.2% |
| 批量价格 | 0.10 美元/小时 | 0.10 美元/小时 | 未在对比项内 | 未在对比项内 |
| 流式价格 | 0.20 美元/小时 | 0.20 美元/小时 | 未在对比项内 | 未在对比项内 |
四组数据放在一起看,Grok Voice Transcribe 2.0 在客服电话与对话场景上的优势最明显:7.1% 与 3.3% 的词错误率比 Gemini 3.5 Transcribe 的 15.9%、5.7% 分别低了 8.8 与 2.4 个百分点,也优于 MAI-Transcribe-2 的 9.3%、7.0%。口述凭证是唯一被反超的一项——MAI-Transcribe-2 以 2.6% 领先 3.2%;多语言短句则以 6.8% 略优于 ElevenLabs Scribe v2 的 7.1%。需说明的是,以上数值均为 xAI 内部评测集口径,其他厂商未在同一组数据上公布结果。
同赛道还有一条以流式音频理解为切入点的路线:Muse Voice Transcribe(Meta 推出的实时音频感知与流式语音转写模型,支持 20 余名说话者分轨与超过 1 小时的长音频,发布时曾在 Artificial Analysis 流式转写榜登顶)。把它与本模型放在一起看,更容易判断榜首更替发生在哪几个指标上。
Grok Voice Transcribe 2.0 的应用场景与适用人群
该模型面向音频质量不可控、又需要结构化转写结果的生产场景:
- 客服与呼叫中心质检:8 kHz 电话音频是公认难点,7.1% 的词错误率配合说话人分离,可直接支撑通话摘要、合规抽检与工单归档。
- 会议与访谈记录:词级时间戳与置信度能定位到具体句子,低置信段落便于人工复核,长音频无需切片即可整段处理。
- 视频字幕与内容转写:批量接口支持文件与 URL,Loom 的实践说明转写结果可以直接进入下游工作流,而不只是留档。
- 语音智能体与车机交互:智能轮次检测与 100 个术语偏置适合命令词密集的场景,多语言短句提升也直接作用于车内指令。
适用人群:需要在真实音频上做转写的工程团队;客服、会议与内容平台的产品负责人;以及正在比对各家转写 API 单价与词错误率、准备切换供应商的技术决策者。
Grok Voice Transcribe 2.0 的使用方法
模型通过 xAI 的 Speech-to-Text API 提供,已有集成无需改代码:
- 获取密钥:在 Grok Voice Transcribe 2.0 官方公告 页进入 API 控制台创建密钥,确认可访问
grok-voice-transcribe-2.0。 - 选择转写方式:录制文件与 URL 走批量接口(单文件上限 500 MB),实时音频走 WebSocket 流式接口,地址为
wss://api.x.ai/v1/stt。 - 打开配置项:说话人分离、词级时间戳、8 声道与术语偏置都可直接启用且不额外计费,术语偏置每请求最多 100 个。
- 安排迁移:2.0 将很快成为 API 默认版本,1.0 会在数周内弃用;过渡期如需留在旧版,可固定
grok-voice-transcribe-1.0。
跨语言录音建议先开自动语言检测跑一遍,确认中途切换语言的分段符合预期,再把回调逻辑绑到语言标签上。
Grok Voice Transcribe 2.0 的价格与开源情况
Grok Voice Transcribe 2.0 的定价与上一代完全一致:批量转写 0.10 美元每音频小时,流式转写 0.20 美元每音频小时,说话人分离、时间戳与术语偏置都包含在内,不额外计费。按官方给出的对比,这一档位低于同批列出的 ElevenLabs Scribe v2(0.22 与 0.39 美元)与 Deepgram Nova-3(0.26 与 0.46 美元),属于「精度提升但不涨价」的定价策略,对长音频批处理客户尤其明显。
权重方面,该模型为闭源商用模型,只通过 API 提供服务,不支持本地部署,也不提供权重下载。这一取向与 xAI 其他音频产品一致:说话人分离这类需在服务端会话中配置的能力只在托管接口开放。对数据出域敏感的团队需在接入前评估音频数据的合规路径。
Grok Voice Transcribe 2.0 的常见问题
Grok Voice Transcribe 2.0 的价格是多少?
批量转写 0.10 美元每音频小时,流式转写 0.20 美元每音频小时,与上一代相同,说话人分离、词级时间戳与关键术语偏置均不额外收费。
Grok Voice Transcribe 2.0 的准确率如何?
xAI 称其在公开的 Artificial Analysis 流式榜单 32 个模型中准确率排名第一,并在四组内部评测集上全部优于上一代。
Grok Voice Transcribe 2.0 支持多少种语言?
可转写数十种语言,自动检测语种并支持录音中途的语言切换;官方短句评测覆盖 19 种语言。
Grok Voice Transcribe 1.0 还能继续用吗?
可以但时间有限。2.0 将很快成为 API 默认版本,1.0 会在数周内弃用,过渡期可固定 grok-voice-transcribe-1.0。
浙公网安备33010202004812号