Gemini 3.5 Transcribe是谷歌于2026年8月推出的智能语音转文本与自动整理模型,主要用于将语音实时转换为整洁文本,支持自动删除口头禅与自我修正内容,覆盖85种以上语言,适用于语音输入、会议转写与Agent语音交互场景。
| 基础信息 | 内容 |
|---|---|
| 开发公司/团队 | Google(谷歌),Gemini Audio团队 |
| 发布时间 | 2026年8月26日 |
| 产品定位 | 智能语音转文本与自动整理模型,主打从逐字记录迈向理解式转写 |
| 支持语言 | 85种以上,自动语言检测与中途切换 |
| 说话者识别 | 最多3人(预录音频),逐词时间戳 |
| 词错率(WER) | 流式4.0%/非流式2.6%(Artificial Analysis) |
| 前代对比 | 相比Chirp 3速度提升约70%,Chirp 3词错率7.32% |
| API端点 | gemini-3.5-transcribe-live(实时)/ gemini-3.5-transcribe(预录) |
| 可用平台 | Google AI Studio、Gemini Enterprise Agent Platform(公开预览) |

Gemini 3.5 Transcribe的核心能力
与Gemini 3.5 Flash同属Gemini 3.5系列,但Transcribe专攻语音入口的智能转写,与Gemini 3.5 Live Translate共同构成Gemini Audio矩阵,分别覆盖转写与翻译赛道。
开发时间线
2026年8月26日,谷歌在官方博客正式发布Gemini 3.5 Transcribe,由Gemini Audio团队发布。模型当日同步上线Google AI Studio公开预览,同时已先行在Pixel 11的Gboard Rambler与Gemini macOS应用中落地,Antigravity与Chrome即将接入。
智能转写与口头禅删除
核心差异化在于”理解式转写”而非”逐字记录”。当用户说出”周二——不,周三见面”时,模型识别自我修正后直接输出”周三见面”,同时删除”嗯””呃”等口头禅,完成标点与格式整理。用户可提供自定义词表适配专业术语。模型支持85种以上语言,具备自动语言检测与中途切换,预录音频支持3人说话者标注。
函数调用与Agent集成
模型不只做终端转写,更是Agent语音链路的入口组件。通过函数调用可将图片生成、文件分析等任务委托给其他Gemini模型执行,目前已见于macOS版Gemini应用。语音转写不再是流水线终点,而是Agent工具调用循环中的路由节点,减少中间环节延迟。
Gemini 3.5 Transcribe与主流语音转文本模型的对比
| 对比维度 | Gemini 3.5 Transcribe | Chirp 3 | GPT-Realtime-Whisper | Hy ASR 3.0 preview |
|---|---|---|---|---|
| 出品方 | Google(前代) | OpenAI | 腾讯混元 | |
| 发布时间 | 2026年8月26日 | 2026年(更早) | 2026年5月 | 2026年8月4日 |
| 支持语言 | 85种以上 | 未公开 | 多语言 | 中文+20种方言 |
| 词错率(WER) | 流式4.0%/非流式2.6% | 7.32% | 未公开 | 中文3.34%/英语2.62% |
| 说话者识别 | 3人 | 未支持 | 未公开 | 未公开 |
| 特色功能 | 自动删口头禅+函数调用+自定义词表 | 传统语音转文字 | 实时转写+字幕生成 | 上下文理解+方言识别 |
| 延迟 | 流式低于1秒 | 基线 | 实时低延迟 | 未公开 |
注:以上数据来源于谷歌官方公告(2026年8月26日)、Artificial Analysis第三方评测、IT之家报道及各产品官方文档。
从数据可以看出,Gemini 3.5 Transcribe的突破不在纯准确率,而在转写范式转变——从”逐字记录”迈向”理解式转写”。流式4.0%的WER相比Chirp 3的7.32%显著提升,但更关键的是自动删口头禅与函数调用使其成为Agent语音链路入口。相比GPT-Realtime-Whisper侧重实时字幕,Transcribe更强调智能整理与Agent集成;相比国产Hy ASR 3.0 preview在中文WER(3.34%)上的优势,Transcribe以85种语言覆盖形成差异化。
Gemini 3.5 Transcribe的应用场景与适用人群
结合官方资料与模型能力,Gemini 3.5 Transcribe适合以下场景:
- 语音输入与口述编辑:通过Gboard Rambler实现语音整理成文,适合移动端长文本创作
- 会议与通话转写:预录音频支持3人说话者识别与逐词时间戳,适用于会议记录与访谈分析
- 多语言实时沟通:85种以上语言自动检测与中途切换,适用于跨语言会议
- Agent语音交互:函数调用使转写结果直接进入Agent工具调用循环,适用于语音助手与智能客服
适用人群:移动端内容创作者、会议记录与访谈分析团队、多语言客服产品经理,以及构建语音Agent交互链路的AI应用开发者。需注意,法律取证、医疗记录等需严格保留原话的场景中,模型的”智能润色”可能改变原始措辞,应谨慎评估。
如何使用Gemini 3.5 Transcribe
Gemini 3.5 Transcribe已通过Google AI Studio与Gemini Enterprise Agent Platform开放公开预览。使用前需满足以下前提条件:
- 已注册的Google账号:用于登录AI Studio或Gemini Enterprise平台
- 稳定的网络访问环境:能够访问Google AI Studio与Gemini API
- 预录音频文件不超过1小时:批量转写端点的单文件时长限制
满足以上条件后,按以下步骤调用:
- 选择接入平台:根据场景选择Google AI Studio官方平台作为入口
- 选择API端点:实时场景使用
gemini-3.5-transcribe-live(Live API双向流式,延迟低于1秒),预录音频使用gemini-3.5-transcribe(Interactions API,支持说话者归属与词级时间戳) - 配置自定义词表:如需识别专业术语,在请求中传入自定义词汇列表
- 提交音频获取结果:实时端点流式返回转写文本,批量端点返回带说话者标签与时间戳的转录
- 启用函数调用(可选):在Agent场景中配置模型将复杂任务委托给其他Gemini模型执行
目前模型处于公开预览阶段,谷歌尚未公布正式定价。Chrome浏览器的”随说随写”功能即将接入。
Gemini 3.5 Transcribe的可用平台与定价
Gemini 3.5 Transcribe采用”消费者先行+API后跟”策略。模型在面向开发者开放前,已先行在Pixel 11 Gboard Rambler与Gemini macOS应用中完成实战验证。消费者端通过Gboard与Gemini应用直接使用,开发者端通过Google AI Studio获取API接入。定价方面,谷歌在发布博客中未提及具体价格,目前公开预览阶段可免费试用,正式计费方案需等待官方后续公布。
Gemini 3.5 Transcribe常见问题
Gemini 3.5 Transcribe和Chirp 3有什么区别?
Gemini 3.5 Transcribe是Chirp 3的直接继任者。速度提升约70%,词错率从7.32%降至流式4.0%/非流式2.6%;新增自动删除口头禅、自我修正识别与函数调用,支持85种以上语言与3人说话者识别。
Gemini 3.5 Transcribe是免费的吗?
目前公开预览阶段可免费试用,谷歌未公布正式定价。消费者端可通过Pixel 11的Gboard与Gemini应用直接使用。
Gemini 3.5 Transcribe支持中文吗?
支持。模型覆盖85种以上语言与方言,具备自动语言检测与中途切换能力,可处理多语言混说场景,中文属于支持语言之一。
Gemini 3.5 Transcribe能保留原始语音的逐字记录吗?
默认不能。模型会自动删除口头禅并整理自我修正,生成”理解式转写”结果。法律取证、医疗记录等需严格保留原话的场景应谨慎评估。
浙公网安备33010202004812号