发布日期:2026年8月14日
数据来源:Google DeepMind公开信息整理
关键词:Gemini 3.7 Flash、Google AI、AI Agent、代码生成、大模型API
2026年8月13日,Google DeepMind正式推出Gemini 3.7 Flash。
作为Gemini Flash系列的新版本,3.7 Flash并没有采用单纯扩大模型规模的路线,而是将优化重点放在实际任务执行能力上,包括代码开发、多步骤Agent任务以及专业知识处理。
此次更新距离上一代Gemini 3.6 Flash发布仅约三周,更新节奏明显加快。
从公开测试数据来看,Gemini 3.7 Flash在编程和自动化任务方面取得较大提升:
- FrontierCode 1.1测试达到43.6%;
- DeepSWE v1.1达到65.3%;
- AutomationBench提升至30.4%。
其中FrontierCode 1.1成绩超过Claude Sonnet 5和GPT-5.6 Terra,显示Google正在进一步强化Flash系列在开发者场景中的竞争力。
一、Gemini 3.7 Flash核心变化:从聊天模型向任务执行模型发展
过去,Flash系列模型主要强调:
- 响应速度;
- 较低调用成本;
- 日常AI任务处理能力。
而Gemini 3.7 Flash的升级方向更加偏向Agent应用。
此次主要提升集中在三个方面:
1. 编程能力增强
对于开发者而言,模型是否能够完成真实工程任务,比简单生成代码更加重要。
Gemini 3.7 Flash重点优化:
- 代码理解;
- Debug分析;
- Web应用生成;
- 前端页面还原;
- 项目级代码修改。
模型目标从“回答代码问题”逐渐转向“辅助完成开发流程”。
2. Agent任务执行能力提升
AI Agent需要持续执行多个步骤。
例如:
分析需求 → 制定方案 → 调用工具 → 修改文件 → 验证结果。
在这一过程中,模型容易出现:
- 步骤遗漏;
- 工具调用失败;
- 无限循环。
Gemini 3.7 Flash针对这些问题进行了优化,提高了多步骤任务执行稳定性。
3. 专业知识处理能力改善
除了代码领域,Gemini 3.7 Flash在知识型任务中也有所提升。
例如Harvey LAB-AA专业知识测试:
Gemini 3.7 Flash:
90.7%
超过:
- Claude Sonnet 5:90.1%
- GPT-5.6 Terra:85.2%
这说明Flash系列正在从轻量级问答模型向综合任务助手方向发展。
二、基准测试表现:编程和自动化任务优势明显
Google公布的测试数据主要覆盖:
- 编程能力;
- 软件工程Agent;
- 自动化执行;
- 长流程任务。
Gemini 3.6 → Gemini 3.7升级变化
| 测试项目 | Gemini 3.6 Flash | Gemini 3.7 Flash | 提升 |
|---|---|---|---|
| FrontierCode 1.1 | 34.4% | 43.6% | +9.2个百分点 |
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3个百分点 |
| WebDev Arena | 1538 | 1588 | +50 |
| AutomationBench | 17.0% | 30.4% | +13.4个百分点 |
可以看到,软件开发相关能力提升最明显。
尤其DeepSWE v1.1,从49.0提升至65.3%,说明模型对于工程任务理解能力增强。
三、与主流模型对比:不同模型侧重点不同
目前AI编程模型竞争已经从单纯比较代码生成能力,转向比较完整Agent能力。
部分公开数据:
| 测试项目 | Gemini 3.7 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 53.8% | 69.6% |
| AutomationBench | 30.4% | 10.7% | 23.6% |
| Terminal-Bench 2.1 | 85.8% | - | 87.4% |
从结果来看:
Gemini 3.7 Flash:
- 编程生成能力突出;
- 自动化任务表现领先;
- Web开发场景优势明显。
GPT-5.6 Terra:
- 软件工程复杂任务仍保持较强优势。
Claude Sonnet 5:
- 在部分代码任务中表现稳定。
不同模型并不存在绝对替代关系,需要根据实际应用场景选择。
四、模型规格:1M上下文与thinking模式
Gemini 3.7 Flash延续了大上下文能力。
公开信息显示:
上下文窗口:
1M tokens
最大输出:
64K tokens
同时新增三档推理模式:
- low;
- medium;
- high。
不同模式对应不同任务。
low模式
适合:
- 简单问答;
- 内容整理;
- 数据格式转换。
优势:
响应速度快,资源消耗低。
medium模式
适合:
- 代码分析;
- Agent任务;
- 多步骤处理。
属于日常开发推荐模式。
high模式
适合:
- 复杂算法;
- 系统设计;
- 深度推理任务。
但调用成本和时间也会增加。
五、API接口变化:Interactions API成为新的推荐方式
Gemini 3.7 Flash同步推出新的Interactions API。
相比传统Chat Completions模式,新接口更加适配Agent应用。
主要变化包括:
1. 推理控制方式调整
过去:
通过temperature、top_p等参数调整。
现在:
通过thinking_level控制:
- low;
- medium;
- high。
2. 多轮任务管理优化
传统方式需要客户端维护完整消息记录。
新方式支持通过interaction ID管理上下文。
对于长期运行的Agent任务,这种设计更加方便。
3. 更适合工具调用场景
Interactions API更加接近:
- 自动执行;
- 工具调用;
- 长流程任务。
这也是Google向Agent生态发展的信号。
六、Gemini 3.7 Flash与DeepSeek V4 Pro对比
2026年8月,多款国产与海外模型同步升级。
Gemini 3.7 Flash和DeepSeek V4 Pro都是当前开发者关注的模型。
简单比较:
| 维度 | Gemini 3.7 Flash | DeepSeek V4 Pro |
|---|---|---|
| 上下文 | 1M tokens | 1M tokens |
| 最大输出 | 64K tokens | 384K tokens |
| DeepSWE | 65.3% | 62.7% |
| 特点 | Agent生态、代码能力 | 长输出、成本优势 |
如果关注:
- Google生态;
- 多模态能力;
- Agent工具链;
Gemini 3.7 Flash具有优势。
如果关注:
- 长文本输出;
- API成本;
- 国产模型生态;
DeepSeek V4 Pro也是一个选择。
七、API统一管理成为多模型使用趋势
随着模型数量增加,开发团队面临的问题也逐渐变化。
以前:
选择一个模型即可。
现在:
一个项目可能同时需要:
- 编程模型;
- 推理模型;
- 多模态模型。
因此,统一API管理方式开始受到关注。
例如4SAPI这类模型接口聚合平台,可以帮助开发者通过统一入口调用不同模型。
这种方式主要价值在于:
- 减少多个平台切换成本;
- 统一管理API接口;
- 根据任务选择不同模型。
近期DeepSeek系列模型价格调整,也让部分开发者重新评估模型调用成本。
通过API聚合方式,可以根据实际需求灵活选择模型,在性能、稳定性和成本之间寻找更合适的组合。
八、Gemini 3.7 Flash适合哪些使用场景?
从目前公开能力来看,比较适合:
1. AI编程辅助
例如:
- 代码生成;
- Bug分析;
- 项目理解;
- 自动化开发。
2. 企业Agent应用
例如:
- 自动处理业务流程;
- 文档分析;
- 数据整理;
- 工具调用。
3. 多模态应用
Gemini系列长期布局多模态能力。
3.7 Flash支持文本、图片、视频、音频等输入形式,适合构建综合型AI应用。
九、开发者使用时需要注意的问题
虽然Gemini 3.7 Flash能力提升明显,但实际应用仍需要考虑工程因素。
1. 接口迁移
如果原项目使用旧版接口,需要注意:
- 参数变化;
- SDK更新;
- 调用方式调整。
2. 成本控制
Agent任务通常比普通聊天消耗更多Token。
需要关注:
- 请求频率;
- 上下文长度;
- 推理模式选择。
3. 权限管理
如果用于代码Agent,需要控制:
- 文件访问权限;
- 工具执行权限;
- 数据安全范围。
总结
Gemini 3.7 Flash的发布,体现了Google对于AI Agent方向的进一步投入。
此次升级重点不在模型规模,而在真实任务完成能力。
从公开测试来看:
- FrontierCode 1.1达到43.6%;
- DeepSWE v1.1达到65.3%;
- AutomationBench提升明显。
同时,Interactions API的推出,也代表Google正在围绕Agent重新设计模型调用方式。
未来开发者选择大模型时,除了关注单项能力,还需要综合考虑:
- 模型性能;
- API成本;
- 工程接入难度;
- 长期维护成本。
Gemini 3.7 Flash、DeepSeek V4 Pro以及其他主流模型之间的竞争,也将推动AI开发生态进一步成熟。
本文内容整理截至2026年8月14日,模型价格、接口能力及官方政策请以Google AI开发平台后续公告为准。




