返回博客

Gemini 3.7 Flash 发布解析:三周完成迭代,Agent与编程能力成为升级重点

人工智能3124
Gemini 3.7 Flash 发布解析:三周完成迭代,Agent与编程能力成为升级重点

发布日期:2026年8月14日
数据来源:Google DeepMind公开信息整理
关键词:Gemini 3.7 Flash、Google AI、AI Agent、代码生成、大模型API

2026年8月13日,Google DeepMind正式推出Gemini 3.7 Flash。

作为Gemini Flash系列的新版本,3.7 Flash并没有采用单纯扩大模型规模的路线,而是将优化重点放在实际任务执行能力上,包括代码开发、多步骤Agent任务以及专业知识处理。

此次更新距离上一代Gemini 3.6 Flash发布仅约三周,更新节奏明显加快。

从公开测试数据来看,Gemini 3.7 Flash在编程和自动化任务方面取得较大提升:

其中FrontierCode 1.1成绩超过Claude Sonnet 5和GPT-5.6 Terra,显示Google正在进一步强化Flash系列在开发者场景中的竞争力。


一、Gemini 3.7 Flash核心变化:从聊天模型向任务执行模型发展

过去,Flash系列模型主要强调:

而Gemini 3.7 Flash的升级方向更加偏向Agent应用。

此次主要提升集中在三个方面:

1. 编程能力增强

对于开发者而言,模型是否能够完成真实工程任务,比简单生成代码更加重要。

Gemini 3.7 Flash重点优化:

模型目标从“回答代码问题”逐渐转向“辅助完成开发流程”。


2. Agent任务执行能力提升

AI Agent需要持续执行多个步骤。

例如:

分析需求 → 制定方案 → 调用工具 → 修改文件 → 验证结果。

在这一过程中,模型容易出现:

Gemini 3.7 Flash针对这些问题进行了优化,提高了多步骤任务执行稳定性。


3. 专业知识处理能力改善

除了代码领域,Gemini 3.7 Flash在知识型任务中也有所提升。

例如Harvey LAB-AA专业知识测试:

Gemini 3.7 Flash:

90.7%

超过:

这说明Flash系列正在从轻量级问答模型向综合任务助手方向发展。


二、基准测试表现:编程和自动化任务优势明显

Google公布的测试数据主要覆盖:

Gemini 3.6 → Gemini 3.7升级变化

测试项目Gemini 3.6 FlashGemini 3.7 Flash提升
FrontierCode 1.134.4%43.6%+9.2个百分点
DeepSWE v1.149.0%65.3%+16.3个百分点
WebDev Arena15381588+50
AutomationBench17.0%30.4%+13.4个百分点

可以看到,软件开发相关能力提升最明显。

尤其DeepSWE v1.1,从49.0提升至65.3%,说明模型对于工程任务理解能力增强。


三、与主流模型对比:不同模型侧重点不同

目前AI编程模型竞争已经从单纯比较代码生成能力,转向比较完整Agent能力。

部分公开数据:

测试项目Gemini 3.7 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%42.7%41.3%
DeepSWE v1.165.3%53.8%69.6%
AutomationBench30.4%10.7%23.6%
Terminal-Bench 2.185.8%-87.4%

从结果来看:

Gemini 3.7 Flash:

GPT-5.6 Terra:

Claude Sonnet 5:

不同模型并不存在绝对替代关系,需要根据实际应用场景选择。


四、模型规格:1M上下文与thinking模式

Gemini 3.7 Flash延续了大上下文能力。

公开信息显示:

上下文窗口:

1M tokens

最大输出:

64K tokens

同时新增三档推理模式:

不同模式对应不同任务。

low模式

适合:

优势:

响应速度快,资源消耗低。


medium模式

适合:

属于日常开发推荐模式。


high模式

适合:

但调用成本和时间也会增加。


五、API接口变化:Interactions API成为新的推荐方式

Gemini 3.7 Flash同步推出新的Interactions API。

相比传统Chat Completions模式,新接口更加适配Agent应用。

主要变化包括:

1. 推理控制方式调整

过去:

通过temperature、top_p等参数调整。

现在:

通过thinking_level控制:


2. 多轮任务管理优化

传统方式需要客户端维护完整消息记录。

新方式支持通过interaction ID管理上下文。

对于长期运行的Agent任务,这种设计更加方便。


3. 更适合工具调用场景

Interactions API更加接近:

这也是Google向Agent生态发展的信号。


六、Gemini 3.7 Flash与DeepSeek V4 Pro对比

2026年8月,多款国产与海外模型同步升级。

Gemini 3.7 Flash和DeepSeek V4 Pro都是当前开发者关注的模型。

简单比较:

维度Gemini 3.7 FlashDeepSeek V4 Pro
上下文1M tokens1M tokens
最大输出64K tokens384K tokens
DeepSWE65.3%62.7%
特点Agent生态、代码能力长输出、成本优势

如果关注:

Gemini 3.7 Flash具有优势。

如果关注:

DeepSeek V4 Pro也是一个选择。


七、API统一管理成为多模型使用趋势

随着模型数量增加,开发团队面临的问题也逐渐变化。

以前:

选择一个模型即可。

现在:

一个项目可能同时需要:

因此,统一API管理方式开始受到关注。

例如4SAPI这类模型接口聚合平台,可以帮助开发者通过统一入口调用不同模型。

这种方式主要价值在于:

近期DeepSeek系列模型价格调整,也让部分开发者重新评估模型调用成本。

通过API聚合方式,可以根据实际需求灵活选择模型,在性能、稳定性和成本之间寻找更合适的组合。


八、Gemini 3.7 Flash适合哪些使用场景?

从目前公开能力来看,比较适合:

1. AI编程辅助

例如:


2. 企业Agent应用

例如:


3. 多模态应用

Gemini系列长期布局多模态能力。

3.7 Flash支持文本、图片、视频、音频等输入形式,适合构建综合型AI应用。


九、开发者使用时需要注意的问题

虽然Gemini 3.7 Flash能力提升明显,但实际应用仍需要考虑工程因素。

1. 接口迁移

如果原项目使用旧版接口,需要注意:


2. 成本控制

Agent任务通常比普通聊天消耗更多Token。

需要关注:


3. 权限管理

如果用于代码Agent,需要控制:


总结

Gemini 3.7 Flash的发布,体现了Google对于AI Agent方向的进一步投入。

此次升级重点不在模型规模,而在真实任务完成能力。

从公开测试来看:

同时,Interactions API的推出,也代表Google正在围绕Agent重新设计模型调用方式。

未来开发者选择大模型时,除了关注单项能力,还需要综合考虑:

Gemini 3.7 Flash、DeepSeek V4 Pro以及其他主流模型之间的竞争,也将推动AI开发生态进一步成熟。

本文内容整理截至2026年8月14日,模型价格、接口能力及官方政策请以Google AI开发平台后续公告为准。

标签:Gemini 3.7 FlashGoogle AIAI编程AI Agent大模型API

推荐阅读

探索更多前沿洞察与行业干货。