Gemini 3.8 Live是一款由谷歌(Google)于2026年9月推出的实时语音对话模型,主要用于实时语音对话与语音智能体交互,支持端到端语音输入输出、近实时视觉理解与后台工具调用,适用于智能客服、语音助手与多模态人机交互等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 实时语音对话模型 |
| 出品方 | 谷歌 Google DeepMind |
| 发布时间 | 2026年9月15日 |
| 底模版本 | 基于 Gemini 3 Pro 训练 |
| 上下文 | 128K 输入 / 64K 输出 |
| 支持语言 | 97 种,对话中自动切换 |
| 计费方式 | 按 token 或分钟计费,有免费层 |

Gemini 3.8 Live 的核心能力
Gemini 3.8 Live 把语音理解、推理与语音生成压进同一套端到端架构,让机器在「听、想、说」之间不再有明显停顿。它提供标准版与 Extended Thinking 两档:前者面向高并发低成本场景,后者用于多步推理任务,便于按任务难度分配算力。
端到端语音对话(audio-to-audio)
模型直接接收音频流并输出语音,不再拆成「识别→推理→合成」三步。用户中途插话或换话题时,传统流水线要先等识别完成,延迟高且容易丢上下文;audio-to-audio 架构能即时响应,首包音频延迟约 1.35 秒,接近真人节奏。对依赖按键式 IVR 的客服场景,可直接把「听菜单—按键」变成「直接说需求」。
边想边说的并行推理(Extended Thinking 版)
Extended Thinking 变体在说话的同时做多步推理,会用「让我查一下…」的口吻实时播报进度,后台并行跑工具调用。例如用户说「帮我订明天去上海的高铁,再查下天气」,模型一边播报一边并行拉取车次与气象接口,最后一次性念出结果。它在并行推理时会额外消耗推理 token、延迟略高,因此只在任务确实需要多步推理时启用。
近实时视觉理解与多模态输入
模型可读取图像与视频流并近乎实时理解画面,结合语音完成看图对弈、把白板草图转成可运行组件等任务。现场维修时,工程师拍下设备铭牌,模型即时读出型号并口述拆装步骤,把「看文档—再操作」合并为一步;零售巡检中拍货架即可判断陈列问题。
后台工具调用与 API 请求
在持续语音对话中,模型可在不打断交流的前提下发起工具调用与 API 请求,把搜索、订票、数据查询等动作融进对话,让语音助手从「能聊」走向「能办」,这一范式可参考 AI 智能体 的工作方式。调用遵循用户既有权限,越权动作会被拒绝,适合企业内受控环境。
多语言实时切换与长对话记忆
模型在对话中自动识别说话人语言并即时切换,无需开场前锁定语种;中英文混说也不必重新开场,出海产品可复用同一套对话逻辑服务多地区用户。结合 128K tokens 上下文,可在数十轮长对话中保持话题连贯。
Gemini 3.8 Live 与同类语音模型的对比
| 对比维度 | Gemini 3.8 Live | Extended Thinking 版 | GPT-Live |
|---|---|---|---|
| 开发方 | 谷歌 DeepMind | 谷歌 DeepMind | OpenAI |
| 模型定位 | 低成本高并发语音智能体 | 多步推理语音智能体 | 实时语音对话 |
| 支持语言 | 97 种实时切换 | 97 种实时切换 | 多语种 |
| 语音质量指数 | 76.0 | 82.6(第一) | 81.5 |
| Big Bench Audio | 97.7% | 97.7% | 90% |
| 全双工打断 | 91.9% | 91.9% | 94.9% |
| τ-Voice 任务完成 | 未单独公布 | 68.6% | 67.9% |
| 输入音频每小时 | 约 0.84 美元 | 约 3.50 美元 | 约 5.83 美元 |
从公开基准看,Extended Thinking 版语音质量指数 82.6 居首(GPT-Live 81.5、标准版 76.0),Big Bench Audio 两档 Gemini 均为 97.7%、高于 GPT-Live 的 90%,全双工打断由 GPT-Live 以 94.9% 略占优。价格差异最显著:标准版输入音频约 0.84 美元/小时,远低于 Extended Thinking 的 3.50 美元与 GPT-Live 的 5.83 美元。标准版适合呼叫中心等高并发场景,Extended Thinking 适合预订、排障等多步推理任务。以上数值来自 Artificial Analysis 公开评测,实际选型应以自有语音样本回归测试为准。
如果需要了解同家族的文本推理能力,可参考 Gemini 3.8(谷歌此前发布的旗舰推理与编码模型,擅长复杂逻辑、数学与代码任务);两者常配合使用,Live 负责听与说,重推理步骤交给 Gemini 3.8 在后台完成,并共享提示词工程与工具定义,降低多模型维护成本。
Gemini 3.8 Live 的应用场景与适用人群
该模型面向需要「听得懂、答得快、还能办」的实时语音场景,常见落点包括:
- 智能客服与热线:银行、电商、出行的电话与在线客服,支持中途打断、多语种与工单自动生成,可替代部分按键式 IVR。
- 语音助手与车载交互:结合视觉理解完成导航、控车与自然问答,减少屏幕操作,提升驾驶与居家场景安全性。
- 多模态协作:设计师与开发者用语音让模型看图、改草图、生成前端组件或方案,缩短从想法到成品的链路。
- 无障碍与远程协助:视障用户通过语音加视觉理解获取环境描述,现场工程师用语音调取图纸与排障步骤。
适用人群:开发者与语音智能体团队、需要大规模低成本语音交互的企业客服,以及把语音作为首要交互方式的消费级产品团队。受监管行业用户应先评估合规要求。
Gemini 3.8 Live 的使用方法
从开发者接入到企业落地,可按以下步骤开始:
- 申请并接入 API:在 Google AI Studio 领取密钥并创建项目,免费层即可体验基础语音能力,便于先跑通原型。
- 选择模型版本:高并发低成本场景用标准版,多步推理任务用 Extended Thinking 版,也可按任务难度动态切换。
- 接入实时媒体层:Gemini Live API 已集成 Agora、LiveKit、Vercel、Pipecat、LangChain 等实时媒体与编排框架,接入麦克风与扬声器、降噪与流式传输均由框架承接。
- 挂载工具与 API:在对话中注册后台工具调用,让模型在语音流里完成搜索、查询与业务动作;建议先做只读查询,再放开写操作权限。
Gemini 3.8 Live 的价格与开源情况
Gemini 3.8 Live 按量计费:音频输入 3.00 美元/百万 tokens(约 0.005 美元/分钟),输出 12.00 美元/百万 tokens(约 0.018 美元/分钟);文本输入 0.75 美元、输出 4.50 美元/百万 tokens。AI Studio 提供免费层,Extended Thinking 版因推理 token 账单约为标准版 4 倍,应按请求占比测算再放量。
Gemini 3.8 Live 为闭源商业模型,仅通过 Gemini API、AI Studio 与 Gemini Enterprise 私有预览提供,不开放权重与源码。计费可按 tokens 或分钟两种口径,长静音按分钟更划算、高频短交互按 token 更可控;生产流量需关注并发配额与限速。
Gemini 3.8 Live 的常见问题
Gemini 3.8 Live 和 Gemini 3.8 有什么区别?
Gemini 3.8 侧重文本推理与代码,Gemini 3.8 Live 是同家族的实时语音对话模型,面向端到端语音交互,两者能力互补。需要文本推理选前者,需要语音智能体选后者;复杂业务里常配合使用。
Gemini 3.8 Live 基于哪个模型训练?
根据谷歌模型卡,Gemini 3.8 Live 系列基于 Gemini 3 Pro 训练,而非 Flash 版本,因此推理与多步任务底座更强,能支撑 Extended Thinking 的并行推理。
Gemini 3.8 Live 怎么收费?
按 token 与分钟计费,音频输入约 0.005 美元/分钟、输出约 0.018 美元/分钟,AI Studio 有免费层;Extended Thinking 版费用约为标准版 4 倍,应把推理档留给真正需要多步思考的请求。
Gemini 3.8 Live 可以在哪些平台调用?
已上线 Gemini API、AI Studio 与 Gemini Enterprise 私有预览,并逐步接入 Search Live、Gemini 应用与 Workspace 等消费级场景。企业侧建议走 Gemini Enterprise 以获得用量与合规管控。
音频会被用于模型训练吗?
企业数据不被用于模型训练(参照谷歌企业级承诺),生成音频均嵌入 SynthID 水印、经剪辑压缩后仍可检测,便于识别合成语音。涉及个人信息的音频仍需按当地法规留存与脱敏;对外呼叫场景建议明示 AI 身份。
浙公网安备33010202004812号