Gemini 3.5 Transcribe – 谷歌推出的智能语音转文本与自动整理模型

AI模型12小时前更新 智小研
19 0

Gemini 3.5 Transcribe是谷歌于2026年8月推出的智能语音转文本与自动整理模型,主要用于将语音实时转换为整洁文本,支持自动删除口头禅与自我修正内容,覆盖85种以上语言,适用于语音输入、会议转写与Agent语音交互场景。

基础信息内容
开发公司/团队Google(谷歌),Gemini Audio团队
发布时间2026年8月26日
产品定位智能语音转文本与自动整理模型,主打从逐字记录迈向理解式转写
支持语言85种以上,自动语言检测与中途切换
说话者识别最多3人(预录音频),逐词时间戳
词错率(WER)流式4.0%/非流式2.6%(Artificial Analysis)
前代对比相比Chirp 3速度提升约70%,Chirp 3词错率7.32%
API端点gemini-3.5-transcribe-live(实时)/ gemini-3.5-transcribe(预录)
可用平台Google AI Studio、Gemini Enterprise Agent Platform(公开预览)
Gemini 3.5 Transcribe – 谷歌推出的智能语音转文本与自动整理模型

Gemini 3.5 Transcribe的核心能力

Gemini 3.5 Flash同属Gemini 3.5系列,但Transcribe专攻语音入口的智能转写,与Gemini 3.5 Live Translate共同构成Gemini Audio矩阵,分别覆盖转写与翻译赛道。

开发时间线

2026年8月26日,谷歌在官方博客正式发布Gemini 3.5 Transcribe,由Gemini Audio团队发布。模型当日同步上线Google AI Studio公开预览,同时已先行在Pixel 11的Gboard Rambler与Gemini macOS应用中落地,Antigravity与Chrome即将接入。

智能转写与口头禅删除

核心差异化在于”理解式转写”而非”逐字记录”。当用户说出”周二——不,周三见面”时,模型识别自我修正后直接输出”周三见面”,同时删除”嗯””呃”等口头禅,完成标点与格式整理。用户可提供自定义词表适配专业术语。模型支持85种以上语言,具备自动语言检测与中途切换,预录音频支持3人说话者标注。

函数调用与Agent集成

模型不只做终端转写,更是Agent语音链路的入口组件。通过函数调用可将图片生成、文件分析等任务委托给其他Gemini模型执行,目前已见于macOS版Gemini应用。语音转写不再是流水线终点,而是Agent工具调用循环中的路由节点,减少中间环节延迟。

Gemini 3.5 Transcribe与主流语音转文本模型的对比

对比维度Gemini 3.5 TranscribeChirp 3GPT-Realtime-WhisperHy ASR 3.0 preview
出品方GoogleGoogle(前代)OpenAI腾讯混元
发布时间2026年8月26日2026年(更早)2026年5月2026年8月4日
支持语言85种以上未公开多语言中文+20种方言
词错率(WER)流式4.0%/非流式2.6%7.32%未公开中文3.34%/英语2.62%
说话者识别3人未支持未公开未公开
特色功能自动删口头禅+函数调用+自定义词表传统语音转文字实时转写+字幕生成上下文理解+方言识别
延迟流式低于1秒基线实时低延迟未公开

注:以上数据来源于谷歌官方公告(2026年8月26日)、Artificial Analysis第三方评测、IT之家报道及各产品官方文档。

从数据可以看出,Gemini 3.5 Transcribe的突破不在纯准确率,而在转写范式转变——从”逐字记录”迈向”理解式转写”。流式4.0%的WER相比Chirp 3的7.32%显著提升,但更关键的是自动删口头禅与函数调用使其成为Agent语音链路入口。相比GPT-Realtime-Whisper侧重实时字幕,Transcribe更强调智能整理与Agent集成;相比国产Hy ASR 3.0 preview在中文WER(3.34%)上的优势,Transcribe以85种语言覆盖形成差异化。

Gemini 3.5 Transcribe的应用场景与适用人群

结合官方资料与模型能力,Gemini 3.5 Transcribe适合以下场景:

  • 语音输入与口述编辑:通过Gboard Rambler实现语音整理成文,适合移动端长文本创作
  • 会议与通话转写:预录音频支持3人说话者识别与逐词时间戳,适用于会议记录与访谈分析
  • 多语言实时沟通:85种以上语言自动检测与中途切换,适用于跨语言会议
  • Agent语音交互:函数调用使转写结果直接进入Agent工具调用循环,适用于语音助手与智能客服

适用人群:移动端内容创作者、会议记录与访谈分析团队、多语言客服产品经理,以及构建语音Agent交互链路的AI应用开发者。需注意,法律取证、医疗记录等需严格保留原话的场景中,模型的”智能润色”可能改变原始措辞,应谨慎评估。

如何使用Gemini 3.5 Transcribe

Gemini 3.5 Transcribe已通过Google AI Studio与Gemini Enterprise Agent Platform开放公开预览。使用前需满足以下前提条件:

  • 已注册的Google账号:用于登录AI Studio或Gemini Enterprise平台
  • 稳定的网络访问环境:能够访问Google AI Studio与Gemini API
  • 预录音频文件不超过1小时:批量转写端点的单文件时长限制

满足以上条件后,按以下步骤调用:

  1. 选择接入平台:根据场景选择Google AI Studio官方平台作为入口
  2. 选择API端点:实时场景使用gemini-3.5-transcribe-live(Live API双向流式,延迟低于1秒),预录音频使用gemini-3.5-transcribe(Interactions API,支持说话者归属与词级时间戳)
  3. 配置自定义词表:如需识别专业术语,在请求中传入自定义词汇列表
  4. 提交音频获取结果:实时端点流式返回转写文本,批量端点返回带说话者标签与时间戳的转录
  5. 启用函数调用(可选):在Agent场景中配置模型将复杂任务委托给其他Gemini模型执行

目前模型处于公开预览阶段,谷歌尚未公布正式定价。Chrome浏览器的”随说随写”功能即将接入。

Gemini 3.5 Transcribe的可用平台与定价

Gemini 3.5 Transcribe采用”消费者先行+API后跟”策略。模型在面向开发者开放前,已先行在Pixel 11 Gboard Rambler与Gemini macOS应用中完成实战验证。消费者端通过Gboard与Gemini应用直接使用,开发者端通过Google AI Studio获取API接入。定价方面,谷歌在发布博客中未提及具体价格,目前公开预览阶段可免费试用,正式计费方案需等待官方后续公布。

Gemini 3.5 Transcribe常见问题

Gemini 3.5 Transcribe和Chirp 3有什么区别?

Gemini 3.5 Transcribe是Chirp 3的直接继任者。速度提升约70%,词错率从7.32%降至流式4.0%/非流式2.6%;新增自动删除口头禅、自我修正识别与函数调用,支持85种以上语言与3人说话者识别。

Gemini 3.5 Transcribe是免费的吗?

目前公开预览阶段可免费试用,谷歌未公布正式定价。消费者端可通过Pixel 11的Gboard与Gemini应用直接使用。

Gemini 3.5 Transcribe支持中文吗?

支持。模型覆盖85种以上语言与方言,具备自动语言检测与中途切换能力,可处理多语言混说场景,中文属于支持语言之一。

Gemini 3.5 Transcribe能保留原始语音的逐字记录吗?

默认不能。模型会自动删除口头禅并整理自我修正,生成”理解式转写”结果。法律取证、医疗记录等需严格保留原话的场景应谨慎评估。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章