Gemini 3.8 – 谷歌推出的旗舰推理与编码模型

AI模型4天前更新 智小研
31 0

Gemini 3.8是一款由谷歌于2026年9月推出的旗舰推理与编码模型系列,主要用于长程软件工程自动化与多步推理任务,支持仓库级代码改写与漏洞自动修复,适用于开发者、安全研究团队与企业级智能体编排场景。

发布时间2026年9月2日
开发方Google DeepMind
模型变体Gemini 3.8 Flash、Gemini 3.8 Flash Cyber
核心能力长程推理、软件工程自动化、漏洞发现与补丁修复
API价格(Flash)输入 0.75 美元/百万token,输出 3.75 美元/百万token
访问入口Google AI Studio、Vertex AI、Gemini API
Gemini 3.8 – 谷歌推出的旗舰推理与编码模型

Gemini 3.8 核心能力

更努力的推理设计

Google 在发布说明中把 3.8 Flash 的改进概括为“works harder”(更努力)。在复杂任务中,模型会主动执行更多推理步骤、以更高强度迭代调用工具,必要时消耗更多 token 来换取性能上限的提升。这一设计让它在需要长链条推演的基准上明显优于前代:据 Google 官方测评,Gemini 3.8 Flash 在 DeepSWE-1.1(长程软件工程自动化)上取得 73.7% 的成绩,较 Gemini 3.7 Flash 的 65.3% 提升超过 8 个百分点,并领先 OpenAI 的 GPT-5.6 Sol 约 1 个百分点。与同代旗舰相比,阿里云推出的 Qwen 3.8-Max 更侧重中文与多模态场景,而 Gemini 3.8 的强项集中在英文推理与工程化任务。

软件工程自动化

在 Terminal-Bench 1.1(衡量多步编码任务)等 16 个 AI 基准中,Gemini 3.8 Flash 在其中 9 项上同时超过了 Claude Opus 5 与 GPT-5.6 Sol。它不仅能补全单点函数,还能围绕仓库级上下文规划改动、运行测试并自我修正,适合接入持续集成与代码审查流水线。对于需要“读懂整个代码库再动手”的重构类需求,3.8 Flash 的迭代调用能力比一次性生成更接近人类工程师的工作方式。

网络安全专精:Flash Cyber 与 CodeMender

Gemini 3.8 Flash Cyber 是同源的安全研究模型,专注 C/C++ 等语言中的漏洞发现与自动补丁生成。它在 CyberGym 基准上取得 86.2% 的成绩,高于 Claude Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。配套工具 CodeMender 由 Google DeepMind 打造,是一套包含提示词、代码文件与技术资产的 harness,用于定位漏洞、评估严重度并产出补丁。据 Google 披露,Chrome 团队使用 Flash Cyber 后,针对浏览器漏洞产出的正确补丁数量达到竞品的 2.6 倍。

Gemini 3.8 与同档模型对比

维度Gemini 3.8 FlashQwen 3.8-MaxGPT-5.6 Sol
开发方Google DeepMind阿里巴巴通义千问OpenAI
模型定位通用推理与编码,主打长程软件工程与漏洞修复千问旗舰级智能体模型,重点提升编程、办公、科研及长周期任务新一代旗舰推理模型,面向复杂推理、编码与智能体
参数规模官方未公布总参数 2.4 万亿,激活参数 95B官方未公布,第三方估算约 3 万亿
推理强度调节支持 effort 参数控制推理强度与 token 消耗支持 reasoning_effort 参数调节支持 none、low、medium、high、xhigh 多档
开源能力闭源,仅通过 API 提供服务Max 系列首次开放权重,计划通过 Hugging Face 发布闭源,仅通过官方 API 与产品提供服务
软件工程基准DeepSWE-1.1 73.7%SWE-bench Pro 67.7 分SWE-bench Pro 64.6 分
长程任务表现16 项 AI 基准中 9 项领先同代旗舰完成 365 天电商经营模拟与芯片设计优化等自主任务暂无公开同规模长周期自主任务案例

注:Gemini 3.8 Flash 数据来自 Google 官方发布说明;Qwen 3.8-Max 与 GPT-5.6 Sol 的规格与基准分数来自各自官方公布口径。DeepSWE-1.1 与 SWE-bench Pro 属不同基准,分数不可直接横向换算,仅供定位参照。

从官方数据可以看出,Gemini 3.8 Flash 把长程编码与漏洞修复两项能力同时推高;Qwen 3.8-Max 与 GPT-5.6 Sol 则分别在长周期自主任务与通用推理上各有侧重。当前旗舰模型的主战场已明显转向“能自己改代码、能自己修漏洞”的工程智能。

Gemini 3.8 的应用场景与适用人群

Gemini 3.8 在以下场景具备直接价值:

  • 软件工程自动化:在 CI/CD 中承担代码审查、测试用例生成与仓库级重构,减少重复劳动。
  • 安全研究与合规:Flash Cyber 面向漏洞扫描、补丁评估与威胁建模,缩短高危漏洞的响应窗口。
  • 企业知识工作:结合 Google 生态(Workspace、Vertex AI)做长文档推理、数据分析与多步任务编排。

适用人群: Gemini 3.8 主要面向具备 API 接入能力的开发者、安全研究员与企业技术团队。对希望用更少人工完成代码与安全的自动化团队,Flash 与 Flash Cyber 的组合提供了从“写代码”到“修漏洞”的端到端能力;个人开发者则可从 Google AI Studio 免费额度起步验证效果。

如何使用 Gemini 3.8

Gemini 3.8 Flash 已上线 Google 官方渠道,Flash Cyber 需通过 Fairwind Program 早期访问。接入步骤如下:

  1. 获取访问权限:在 Gemini 3.8 官网查看发布说明,用 Google 账号登录 Google AI Studio,在模型列表中启用 Gemini 3.8 Flash。
  2. 创建密钥:在 AI Studio 生成 API Key,或在 Vertex AI 控制台开通 Gemini API 并绑定结算账号。
  3. 发起调用:通过官方 SDK 或 OpenAI 兼容接口调用,用 effort 参数控制推理强度与 token 消耗。
  4. 申请 Cyber 版本:安全团队提交 Fairwind Program 审核,通过后获取 Flash Cyber 与 CodeMender 工具包。

更完整的定价档位与接入文档可查阅 Google 官方发布说明,接入前建议先用免费额度验证效果。

Gemini 3.8 的价格与开源情况

Gemini 3.8 Flash 的 API 价格维持前代档位:输入 0.75 美元/百万 token、输出 3.75 美元/百万 token,未随能力升级涨价。Flash Cyber 不公开按量计费,而是以 Fairwind Program 早期访问形式提供给政府机构、关键基础设施运营方与负责“广泛软件基础安全”的科技公司,发布首日已有 Snowflake、CrowdStrike、Datadog 等 650 余家单位加入。需要说明的是,Gemini 3.8 系列为闭源模型,不提供权重下载,仅通过 Google 官方 API 与 Vertex AI 提供服务。

关于 Gemini 3.8 的常见问题

Gemini 3.8 和 Gemini 3.7 Flash 有什么区别?

3.8 Flash 是 3.7 Flash 的升级,DeepSWE-1.1 从 65.3% 提升到 73.7%,并新增专注网络安全的 Flash Cyber 变体;API 价格保持不变。

Gemini 3.8 Flash Cyber 怎么获取?

Flash Cyber 通过 Fairwind Program 早期访问计划提供,面向政府、关键基础设施与安全软件企业,需资质审核,不开放公开按量计费。

API 价格有变化吗?

没有。Gemini 3.8 Flash 输入仍为 0.75 美元/百万 token、输出 3.75 美元/百万 token,与 3.7 Flash 一致。

支持哪些调用方式?

可通过 Google AI Studio、Vertex AI 与 Gemini API 调用,并提供 OpenAI 兼容接口,便于现有流水线迁移。

与 GPT-5.6 Sol、Claude Opus 5 相比如何?

在 Google 测评的 16 个基准中,3.8 Flash 在 9 项上同时超过两者;DeepSWE-1.1 领先 GPT-5.6 Sol 约 1%,CyberGym 上 Flash Cyber 以 86.2% 居首。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章