Gemini 3.7 Flash – 谷歌推出的编程与智能体低成本主力模型

AI模型3天前更新 智小研
18 0

Gemini 3.7 Flash是一款由Google于2026年8月13日推出的编程与智能体特化大模型,上下文窗口100万token,主要用于代码生成、软件工程与多步自动化任务,支持三档可调思考模式和半价促销API,适用于代码生成与补全、智能体工作流构建与批量知识处理等低成本高吞吐场景。

基础信息内容
开发方Google
发布时间2026年8月13日(距3.6 Flash仅23天)
上下文窗口1,048,576 token(约100万)
最大输出65,536 token
输入模态文本、图片、音频、视频、PDF
知识截止2026年3月
API价格输入$0.75/输出$3.75每百万token(促销价至2026年12月31日)
产品定位编程与智能体特化的低成本主力模型
适用人群个人开发者、初创团队、企业智能体业务
Gemini 3.7 Flash – 谷歌推出的编程与智能体低成本主力模型

Gemini 3.7 Flash核心能力与性能

这次更新距离上一版Gemini 3.6 Flash只有23天。Google没有重训基座,而是对3.6 Flash的推理层做了算法改进,官方称之为”迄今最智能的编程与智能体主力模型”。旗舰Pro线还在打磨,Flash线先把新的编程和智能体能力交给开发者,两条产品线的更新速度差距越来越明显。

编程能力大幅提升

真实软件工程任务的表现是这次升级的核心。根据Google官方模型卡,Gemini 3.7 Flash在FrontierCode 1.1(生产级编程基准)上得分43.6%,上一版为34.4%;在DeepSWE v1.1(长周期软件工程任务基准)上从约49%跃升至65.3%,提升超过16个百分点。

前端开发方面,WebDev Arena(网页开发人工对战榜)Elo从1538升到1588。Google还强调模型能根据截图、设计稿或设计系统直接生成功能完整的应用布局,做到”看图出码”。

智能体与多步自动化

多步自动化任务成功率接近翻倍,但绝对水平仍需清醒看待。AutomationBench(跨应用业务流程基准)从17.0%升至30.4%,超过GPT-5.6 Terra的23.6%和Claude Sonnet 5的10.7%——这意味着十个多步自动化任务里它仍会失败约七个。Terminal-bench 2.1(终端命令行执行基准)达到85.8%,但在更难的Terminal-bench 3.0上只有14.9%。

官方称模型遇到障碍时会主动检查已完成的工作、澄清意图、调整后续步骤,这正是智能体场景需要的行为模式。长上下文检索能力同步增强:GDM-MRCR v2 128k(多轮长上下文检索基准)从91.8%升至97.0%。

思考模式与输出速度

三档思考模式取代了旧的minimal档位。新模型提供low、medium(默认)、high三档思考等级,思考token按输出价格计费,档位选择成为每次调用成本的主要杠杆。迁移时注意:旧的minimal参数会直接报错,需改为low。

第三方机构Artificial Analysis的独立测试显示,3.7 Flash智能指数56分(3.6 Flash为52),输出速度约340 token/秒、在186个模型中排名第一,但幻觉率高于3.6 Flash,上生产前建议用自己的任务集验证。

Gemini 3.7 Flash与GPT-5.6 Terra、Claude Sonnet 5对比

对比维度Gemini 3.7 FlashGPT-5.6 TerraClaude Sonnet 5
开发方GoogleOpenAIAnthropic
模型定位编程与智能体主力全能旗舰通用主力
AutomationBench完成率30.4%23.6%10.7%
每百万token混合成本(80/20输入输出比)约$1.35(促销价)约$4.00约$3.60

成本是这次发布最大的差异化。按80/20的输入输出比例计算混合成本,Gemini 3.7 Flash约$1.35每百万token,仅为GPT-5.6 Terra的三分之一。对全天候运行智能体的团队来说,这个价差会直接改变架构选型。

不过GPT-5.6 Terra在终端执行和计算机操作类任务上仍保持领先:Terminal-bench 2.1得分87.4%(Flash为85.8%),DeepSWE v1.1得分69.6%(Flash为65.3%)。追求极限任务成功率的场景,旗舰模型仍有不可替代性。站内此前的GPT-5.6评测有更完整的旗舰线对比,同类低成本路线还可以对比DeepSeek V4 Pro

Gemini 3.7 Flash应用场景与适用人群

从官方公布的升级方向和实际能力看,Gemini 3.7 Flash主要面向三类场景:

  • 高频代码生成与重构:FrontierCode 43.6%的成绩配合340 token/秒的输出速度,适合IDE内实时代码补全和批量重构,GitHub Copilot已将其接入为可选核心模型。
  • 智能体工作流:多步工具调用、受阻后自我调整的行为优化,配合100万token上下文,适合代码库审计、跨系统信息整合类Agent。
  • 文档与知识工作:GDP.pdf(复杂文档理解基准)从22.0%升至34.0%,输入原生支持PDF,适合合同、财报、技术文档的批量处理。

适合谁用:预算敏感的个人开发者、需要控制token成本的初创团队、跑大批量智能体任务的企业。如果您的场景是移动端智能助手,同系的Gemini Spark已基于3.7 Flash为AI Pro/Ultra订阅用户提供后台智能体服务。图表理解要求高的场景注意CharXiv(图表推理基准)较3.6略有回退,建议先实测。

如何使用Gemini 3.7 Flash

  • Gemini API / AI Studio模型ID为gemini-3.7-flash,注册后即可调用,这是最直接的入口。
  • 开发工具集成:Android Studio、Google Antigravity已内置;GitHub Copilot中可直接选为代码模型,覆盖VS Code、JetBrains、Xcode。
  • 企业渠道:Gemini Enterprise智能体平台与Gemini Enterprise应用。
  • 个人入口:Gemini应用内的Spark体验(需AI Pro或Ultra订阅,限支持地区)。

从3.6 Flash迁移的注意事项:模型ID直接替换即可,但自定义temperature、top_p、top_k和candidate_count已在3.7 Flash上废弃,需移除;数字thinking_budget要换成字符串thinking_level参数;minimal改为low。官方同时提醒,价格不变不代表token消耗不变,有上线首日报告显示单任务token用量高于3.6,迁移后应重跑代表性提示词对比成本。

Gemini 3.7 Flash的官方资源

Gemini 3.7 Flash价格与已知局限

促销价有明确的截止日期。输入$0.75、输出$3.75每百万token的促销价持续到2026年12月31日,2027年1月1日起自动恢复为$1.50/$7.50——与3.6 Flash发布时的原价持平。做全年成本测算时应按恢复后的价格计算。

局限方面:模型不开源、无开放权重,不支持自部署或离线环境;AutomationBench 30.4%的绝对水平意味着复杂多步任务仍需人工兜底;Artificial Analysis测得幻觉率高于前代,对事实准确性敏感的场景要加验证层;CharXiv图表理解小幅回退。此外部分API聚合渠道上线进度不一,OpenRouter为Day 0支持,其他渠道需确认。

常见问题

Gemini 3.7 Flash和Gemini 3.6 Flash有什么区别?

3.7 Flash不是重新预训练的模型,而是在3.6 Flash基座上改进推理算法的升级版。核心提升在编程和智能体:FrontierCode从34.4%升至43.6%,DeepSWE从约49%升至65.3%,AutomationBench从17.0%升至30.4%。上下文窗口保持100万token不变,价格与3.6 Flash相同。

Gemini 3.7 Flash和GPT-5.6怎么选?

看任务类型和预算。多步自动化和成本敏感场景选3.7 Flash(AutomationBench 30.4%高于Terra的23.6%,混合成本低约三分之二);终端执行、计算机操作和极限推理场景GPT-5.6系列仍领先。大量跑智能体的团队常用Flash做主力、旗舰做兜底的双模型架构。

Gemini 3.7 Flash怎么收费?

促销价为输入$0.75、输出$3.75每百万token,持续到2026年12月31日;2027年1月1日起恢复为$1.50/$7.50。思考token按输出价格计费,思考档位(low/medium/high)是控制成本的主要手段。个人用户可通过Gemini应用的Spark功能使用,需AI Pro或Ultra订阅。

Gemini 3.7 Flash能本地部署吗?

不能。Google未开放3.7 Flash的模型权重,只提供API和云端服务,没有自部署或离线方案。需要本地部署编程模型的用户可以关注开源方案,例如站内介绍过的GLM-5.3和Muse Glimmer等开源权重模型。

迁移到Gemini 3.7 Flash要改什么代码?

三处必须改:模型ID换成gemini-3.7-flash;删掉自定义temperature、top_p、top_k、candidate_count(已废弃会报错);thinking_budget数字参数换成thinking_level字符串,minimal改为low。改完后建议用代表性任务重测token消耗,部分场景用量高于3.6。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章