Gemini 3.7 Flash是一款由Google于2026年8月13日推出的编程与智能体特化大模型,上下文窗口100万token,主要用于代码生成、软件工程与多步自动化任务,支持三档可调思考模式和半价促销API,适用于代码生成与补全、智能体工作流构建与批量知识处理等低成本高吞吐场景。
| 基础信息 | 内容 |
|---|---|
| 开发方 | |
| 发布时间 | 2026年8月13日(距3.6 Flash仅23天) |
| 上下文窗口 | 1,048,576 token(约100万) |
| 最大输出 | 65,536 token |
| 输入模态 | 文本、图片、音频、视频、PDF |
| 知识截止 | 2026年3月 |
| API价格 | 输入$0.75/输出$3.75每百万token(促销价至2026年12月31日) |
| 产品定位 | 编程与智能体特化的低成本主力模型 |
| 适用人群 | 个人开发者、初创团队、企业智能体业务 |

Gemini 3.7 Flash核心能力与性能
这次更新距离上一版Gemini 3.6 Flash只有23天。Google没有重训基座,而是对3.6 Flash的推理层做了算法改进,官方称之为”迄今最智能的编程与智能体主力模型”。旗舰Pro线还在打磨,Flash线先把新的编程和智能体能力交给开发者,两条产品线的更新速度差距越来越明显。
编程能力大幅提升
真实软件工程任务的表现是这次升级的核心。根据Google官方模型卡,Gemini 3.7 Flash在FrontierCode 1.1(生产级编程基准)上得分43.6%,上一版为34.4%;在DeepSWE v1.1(长周期软件工程任务基准)上从约49%跃升至65.3%,提升超过16个百分点。
前端开发方面,WebDev Arena(网页开发人工对战榜)Elo从1538升到1588。Google还强调模型能根据截图、设计稿或设计系统直接生成功能完整的应用布局,做到”看图出码”。
智能体与多步自动化
多步自动化任务成功率接近翻倍,但绝对水平仍需清醒看待。AutomationBench(跨应用业务流程基准)从17.0%升至30.4%,超过GPT-5.6 Terra的23.6%和Claude Sonnet 5的10.7%——这意味着十个多步自动化任务里它仍会失败约七个。Terminal-bench 2.1(终端命令行执行基准)达到85.8%,但在更难的Terminal-bench 3.0上只有14.9%。
官方称模型遇到障碍时会主动检查已完成的工作、澄清意图、调整后续步骤,这正是智能体场景需要的行为模式。长上下文检索能力同步增强:GDM-MRCR v2 128k(多轮长上下文检索基准)从91.8%升至97.0%。
思考模式与输出速度
三档思考模式取代了旧的minimal档位。新模型提供low、medium(默认)、high三档思考等级,思考token按输出价格计费,档位选择成为每次调用成本的主要杠杆。迁移时注意:旧的minimal参数会直接报错,需改为low。
第三方机构Artificial Analysis的独立测试显示,3.7 Flash智能指数56分(3.6 Flash为52),输出速度约340 token/秒、在186个模型中排名第一,但幻觉率高于3.6 Flash,上生产前建议用自己的任务集验证。
Gemini 3.7 Flash与GPT-5.6 Terra、Claude Sonnet 5对比
| 对比维度 | Gemini 3.7 Flash | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|
| 开发方 | OpenAI | Anthropic | |
| 模型定位 | 编程与智能体主力 | 全能旗舰 | 通用主力 |
| AutomationBench完成率 | 30.4% | 23.6% | 10.7% |
| 每百万token混合成本(80/20输入输出比) | 约$1.35(促销价) | 约$4.00 | 约$3.60 |
成本是这次发布最大的差异化。按80/20的输入输出比例计算混合成本,Gemini 3.7 Flash约$1.35每百万token,仅为GPT-5.6 Terra的三分之一。对全天候运行智能体的团队来说,这个价差会直接改变架构选型。
不过GPT-5.6 Terra在终端执行和计算机操作类任务上仍保持领先:Terminal-bench 2.1得分87.4%(Flash为85.8%),DeepSWE v1.1得分69.6%(Flash为65.3%)。追求极限任务成功率的场景,旗舰模型仍有不可替代性。站内此前的GPT-5.6评测有更完整的旗舰线对比,同类低成本路线还可以对比DeepSeek V4 Pro。
Gemini 3.7 Flash应用场景与适用人群
从官方公布的升级方向和实际能力看,Gemini 3.7 Flash主要面向三类场景:
- 高频代码生成与重构:FrontierCode 43.6%的成绩配合340 token/秒的输出速度,适合IDE内实时代码补全和批量重构,GitHub Copilot已将其接入为可选核心模型。
- 智能体工作流:多步工具调用、受阻后自我调整的行为优化,配合100万token上下文,适合代码库审计、跨系统信息整合类Agent。
- 文档与知识工作:GDP.pdf(复杂文档理解基准)从22.0%升至34.0%,输入原生支持PDF,适合合同、财报、技术文档的批量处理。
适合谁用:预算敏感的个人开发者、需要控制token成本的初创团队、跑大批量智能体任务的企业。如果您的场景是移动端智能助手,同系的Gemini Spark已基于3.7 Flash为AI Pro/Ultra订阅用户提供后台智能体服务。图表理解要求高的场景注意CharXiv(图表推理基准)较3.6略有回退,建议先实测。
如何使用Gemini 3.7 Flash
- Gemini API / AI Studio:模型ID为gemini-3.7-flash,注册后即可调用,这是最直接的入口。
- 开发工具集成:Android Studio、Google Antigravity已内置;GitHub Copilot中可直接选为代码模型,覆盖VS Code、JetBrains、Xcode。
- 企业渠道:Gemini Enterprise智能体平台与Gemini Enterprise应用。
- 个人入口:Gemini应用内的Spark体验(需AI Pro或Ultra订阅,限支持地区)。
从3.6 Flash迁移的注意事项:模型ID直接替换即可,但自定义temperature、top_p、top_k和candidate_count已在3.7 Flash上废弃,需移除;数字thinking_budget要换成字符串thinking_level参数;minimal改为low。官方同时提醒,价格不变不代表token消耗不变,有上线首日报告显示单任务token用量高于3.6,迁移后应重跑代表性提示词对比成本。
Gemini 3.7 Flash的官方资源
Gemini 3.7 Flash价格与已知局限
促销价有明确的截止日期。输入$0.75、输出$3.75每百万token的促销价持续到2026年12月31日,2027年1月1日起自动恢复为$1.50/$7.50——与3.6 Flash发布时的原价持平。做全年成本测算时应按恢复后的价格计算。
局限方面:模型不开源、无开放权重,不支持自部署或离线环境;AutomationBench 30.4%的绝对水平意味着复杂多步任务仍需人工兜底;Artificial Analysis测得幻觉率高于前代,对事实准确性敏感的场景要加验证层;CharXiv图表理解小幅回退。此外部分API聚合渠道上线进度不一,OpenRouter为Day 0支持,其他渠道需确认。
常见问题
Gemini 3.7 Flash和Gemini 3.6 Flash有什么区别?
3.7 Flash不是重新预训练的模型,而是在3.6 Flash基座上改进推理算法的升级版。核心提升在编程和智能体:FrontierCode从34.4%升至43.6%,DeepSWE从约49%升至65.3%,AutomationBench从17.0%升至30.4%。上下文窗口保持100万token不变,价格与3.6 Flash相同。
Gemini 3.7 Flash和GPT-5.6怎么选?
看任务类型和预算。多步自动化和成本敏感场景选3.7 Flash(AutomationBench 30.4%高于Terra的23.6%,混合成本低约三分之二);终端执行、计算机操作和极限推理场景GPT-5.6系列仍领先。大量跑智能体的团队常用Flash做主力、旗舰做兜底的双模型架构。
Gemini 3.7 Flash怎么收费?
促销价为输入$0.75、输出$3.75每百万token,持续到2026年12月31日;2027年1月1日起恢复为$1.50/$7.50。思考token按输出价格计费,思考档位(low/medium/high)是控制成本的主要手段。个人用户可通过Gemini应用的Spark功能使用,需AI Pro或Ultra订阅。
Gemini 3.7 Flash能本地部署吗?
不能。Google未开放3.7 Flash的模型权重,只提供API和云端服务,没有自部署或离线方案。需要本地部署编程模型的用户可以关注开源方案,例如站内介绍过的GLM-5.3和Muse Glimmer等开源权重模型。
迁移到Gemini 3.7 Flash要改什么代码?
三处必须改:模型ID换成gemini-3.7-flash;删掉自定义temperature、top_p、top_k、candidate_count(已废弃会报错);thinking_budget数字参数换成thinking_level字符串,minimal改为low。改完后建议用代表性任务重测token消耗,部分场景用量高于3.6。
浙公网安备33010202004812号