Gemini 3.8 Live – 谷歌推出的实时语音对话模型

AI模型43秒前更新 老高
30 0

Gemini 3.8 Live是一款由谷歌(Google)于2026年9月推出的实时语音对话模型,主要用于实时语音对话与语音智能体交互,支持端到端语音输入输出、近实时视觉理解与后台工具调用,适用于智能客服、语音助手与多模态人机交互等方向。

基础信息内容
产品定位实时语音对话模型
出品方谷歌 Google DeepMind
发布时间2026年9月15日
底模版本基于 Gemini 3 Pro 训练
上下文128K 输入 / 64K 输出
支持语言97 种,对话中自动切换
计费方式按 token 或分钟计费,有免费层
Gemini 3.8 Live – 谷歌推出的实时语音对话模型

Gemini 3.8 Live 的核心能力

Gemini 3.8 Live 把语音理解、推理与语音生成压进同一套端到端架构,让机器在「听、想、说」之间不再有明显停顿。它提供标准版与 Extended Thinking 两档:前者面向高并发低成本场景,后者用于多步推理任务,便于按任务难度分配算力。

端到端语音对话(audio-to-audio)

模型直接接收音频流并输出语音,不再拆成「识别→推理→合成」三步。用户中途插话或换话题时,传统流水线要先等识别完成,延迟高且容易丢上下文;audio-to-audio 架构能即时响应,首包音频延迟约 1.35 秒,接近真人节奏。对依赖按键式 IVR 的客服场景,可直接把「听菜单—按键」变成「直接说需求」。

边想边说的并行推理(Extended Thinking 版)

Extended Thinking 变体在说话的同时做多步推理,会用「让我查一下…」的口吻实时播报进度,后台并行跑工具调用。例如用户说「帮我订明天去上海的高铁,再查下天气」,模型一边播报一边并行拉取车次与气象接口,最后一次性念出结果。它在并行推理时会额外消耗推理 token、延迟略高,因此只在任务确实需要多步推理时启用。

近实时视觉理解与多模态输入

模型可读取图像与视频流并近乎实时理解画面,结合语音完成看图对弈、把白板草图转成可运行组件等任务。现场维修时,工程师拍下设备铭牌,模型即时读出型号并口述拆装步骤,把「看文档—再操作」合并为一步;零售巡检中拍货架即可判断陈列问题。

后台工具调用与 API 请求

在持续语音对话中,模型可在不打断交流的前提下发起工具调用与 API 请求,把搜索、订票、数据查询等动作融进对话,让语音助手从「能聊」走向「能办」,这一范式可参考 AI 智能体 的工作方式。调用遵循用户既有权限,越权动作会被拒绝,适合企业内受控环境。

多语言实时切换与长对话记忆

模型在对话中自动识别说话人语言并即时切换,无需开场前锁定语种;中英文混说也不必重新开场,出海产品可复用同一套对话逻辑服务多地区用户。结合 128K tokens 上下文,可在数十轮长对话中保持话题连贯。

Gemini 3.8 Live 与同类语音模型的对比

对比维度Gemini 3.8 LiveExtended Thinking 版GPT-Live
开发方谷歌 DeepMind谷歌 DeepMindOpenAI
模型定位低成本高并发语音智能体多步推理语音智能体实时语音对话
支持语言97 种实时切换97 种实时切换多语种
语音质量指数76.082.6(第一)81.5
Big Bench Audio97.7%97.7%90%
全双工打断91.9%91.9%94.9%
τ-Voice 任务完成未单独公布68.6%67.9%
输入音频每小时约 0.84 美元约 3.50 美元约 5.83 美元

从公开基准看,Extended Thinking 版语音质量指数 82.6 居首(GPT-Live 81.5、标准版 76.0),Big Bench Audio 两档 Gemini 均为 97.7%、高于 GPT-Live 的 90%,全双工打断由 GPT-Live 以 94.9% 略占优。价格差异最显著:标准版输入音频约 0.84 美元/小时,远低于 Extended Thinking 的 3.50 美元与 GPT-Live 的 5.83 美元。标准版适合呼叫中心等高并发场景,Extended Thinking 适合预订、排障等多步推理任务。以上数值来自 Artificial Analysis 公开评测,实际选型应以自有语音样本回归测试为准。

如果需要了解同家族的文本推理能力,可参考 Gemini 3.8(谷歌此前发布的旗舰推理与编码模型,擅长复杂逻辑、数学与代码任务);两者常配合使用,Live 负责听与说,重推理步骤交给 Gemini 3.8 在后台完成,并共享提示词工程与工具定义,降低多模型维护成本。

Gemini 3.8 Live 的应用场景与适用人群

该模型面向需要「听得懂、答得快、还能办」的实时语音场景,常见落点包括:

  • 智能客服与热线:银行、电商、出行的电话与在线客服,支持中途打断、多语种与工单自动生成,可替代部分按键式 IVR。
  • 语音助手与车载交互:结合视觉理解完成导航、控车与自然问答,减少屏幕操作,提升驾驶与居家场景安全性。
  • 多模态协作:设计师与开发者用语音让模型看图、改草图、生成前端组件或方案,缩短从想法到成品的链路。
  • 无障碍与远程协助:视障用户通过语音加视觉理解获取环境描述,现场工程师用语音调取图纸与排障步骤。

适用人群:开发者与语音智能体团队、需要大规模低成本语音交互的企业客服,以及把语音作为首要交互方式的消费级产品团队。受监管行业用户应先评估合规要求。

Gemini 3.8 Live 的使用方法

从开发者接入到企业落地,可按以下步骤开始:

  1. 申请并接入 API:在 Google AI Studio 领取密钥并创建项目,免费层即可体验基础语音能力,便于先跑通原型。
  2. 选择模型版本:高并发低成本场景用标准版,多步推理任务用 Extended Thinking 版,也可按任务难度动态切换。
  3. 接入实时媒体层:Gemini Live API 已集成 Agora、LiveKit、Vercel、Pipecat、LangChain 等实时媒体与编排框架,接入麦克风与扬声器、降噪与流式传输均由框架承接。
  4. 挂载工具与 API:在对话中注册后台工具调用,让模型在语音流里完成搜索、查询与业务动作;建议先做只读查询,再放开写操作权限。

Gemini 3.8 Live 的价格与开源情况

Gemini 3.8 Live 按量计费:音频输入 3.00 美元/百万 tokens(约 0.005 美元/分钟),输出 12.00 美元/百万 tokens(约 0.018 美元/分钟);文本输入 0.75 美元、输出 4.50 美元/百万 tokens。AI Studio 提供免费层,Extended Thinking 版因推理 token 账单约为标准版 4 倍,应按请求占比测算再放量。

Gemini 3.8 Live 为闭源商业模型,仅通过 Gemini API、AI Studio 与 Gemini Enterprise 私有预览提供,不开放权重与源码。计费可按 tokens 或分钟两种口径,长静音按分钟更划算、高频短交互按 token 更可控;生产流量需关注并发配额与限速。

Gemini 3.8 Live 的常见问题

Gemini 3.8 Live 和 Gemini 3.8 有什么区别?

Gemini 3.8 侧重文本推理与代码,Gemini 3.8 Live 是同家族的实时语音对话模型,面向端到端语音交互,两者能力互补。需要文本推理选前者,需要语音智能体选后者;复杂业务里常配合使用。

Gemini 3.8 Live 基于哪个模型训练?

根据谷歌模型卡,Gemini 3.8 Live 系列基于 Gemini 3 Pro 训练,而非 Flash 版本,因此推理与多步任务底座更强,能支撑 Extended Thinking 的并行推理。

Gemini 3.8 Live 怎么收费?

按 token 与分钟计费,音频输入约 0.005 美元/分钟、输出约 0.018 美元/分钟,AI Studio 有免费层;Extended Thinking 版费用约为标准版 4 倍,应把推理档留给真正需要多步思考的请求。

Gemini 3.8 Live 可以在哪些平台调用?

已上线 Gemini API、AI Studio 与 Gemini Enterprise 私有预览,并逐步接入 Search Live、Gemini 应用与 Workspace 等消费级场景。企业侧建议走 Gemini Enterprise 以获得用量与合规管控。

音频会被用于模型训练吗?

企业数据不被用于模型训练(参照谷歌企业级承诺),生成音频均嵌入 SynthID 水印、经剪辑压缩后仍可检测,便于识别合成语音。涉及个人信息的音频仍需按当地法规留存与脱敏;对外呼叫场景建议明示 AI 身份。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章