美国当地时间8月13日,谷歌发布Gemini 3.7 Flash,距离上一代Gemini 3.6 Flash上线仅三周。官方将其定位为“迄今最智能的编码与智能体主力模型”,主打软件工程、知识工作与网页开发场景,并同步推出限时半价:2026年12月31日前,每百万输入token定价0.75美元、输出token定价3.75美元,相当于3.6 Flash首发价的一半。性能与价格的双重变化,很快成为开发者社区讨论的焦点。

性能方面,根据谷歌公布的模型卡,Gemini 3.7 Flash在多个基准上较3.6 Flash明显提升。涨幅最突出的是软件工程与多步骤智能体任务:
- 软件工程基准DeepSWE v1.1从49.0%升至65.3%;
- 编程基准FrontierCode 1.1 Main从34.4%升至43.6%;
- 网页开发竞技场WebDev Arena的Elo分数从1538升至1588;
- 面向复杂文档处理的GDP.pdf从22.0%升至34.0%;
- 衡量企业自动化工作流的AutomationBench从17.0%升至30.4%。
官方同时强调开发者体验的改善:模型遇到障碍时会更多检查已完成的工作、在需要时澄清模糊意图、更忠实地遵循指令,并在多步骤规划与工具调用上投入更多思考,目标是减少人工监督和失败后的反复重试。规格上,3.7 Flash继续支持100万token输入上下文,单次最高输出约6.4万token,可处理文字、图片、音频和视频,知识截止时间为2026年3月。
价格是另一条主线。0.75美元/3.75美元的首发价维持到2026年12月31日,2027年1月1日起恢复为1.50美元/7.50美元。也就是说,谷歌给出的是有效期四个多月的“五折券”,而非永久降价。这一安排被不少观察者解读为:以低门槛吸引开发者把智能体项目跑在Gemini生态上,待迁移成本上升后再恢复标准价。
独立评测机构Artificial Analysis的测试提供了另一组参照。在高推理设置下,Gemini 3.7 Flash的智能指数得分为56,较3.6 Flash的52提高4分;输出速度约每秒340个token,在同类模型中居前,高推理模式下的平均任务时间约1.7分钟。该机构测算,在折扣价下,其高推理模式单任务平均成本约0.4美元,比3.6 Flash低约30%。
此次发布正值Google DeepMind高层调整之后。新上任的高级副总裁Koray Kavukcuoglu在社交平台发文介绍该模型,并提到Flash系列从3.5到3.7仅用了三个月。与此同时,据彭博社此前报道,旗舰型号Gemini 3.5 Pro因编程能力仍需打磨而推迟数月,Flash先行承载新的编程与智能体能力,两条产品线的节奏差异愈发明显。
在可用性方面,模型现已通过Gemini API、Google AI Studio、Android Studio、Antigravity及Gemini Enterprise提供;面向Google AI Pro和Ultra订阅用户的个人智能体Gemini Spark也已切换至3.7 Flash。安全方面,官方表示更新了针对化学、生物、放射、核(CBRN)及网络攻击领域的防护机制。
需要指出的是,上述跑分主要由谷歌自行披露,部分能力仍需在真实项目中验证。有开发者认为,低价与速度固然有吸引力,但智能体更大的考验在于长任务中的可靠性——能否在不偏离目标、不犯错的前提下完成数百个步骤,仍需时间检验。此外,在图表理解(CharXiv)等少数项目上,3.7 Flash并未全面领先上一代,个别指标甚至略有回落。
总体来看,Gemini 3.7 Flash延续了Flash系列“不争能力榜首、在智能、速度与成本之间寻找平衡”的定位,只是这一次的平衡点更明显地向性价比倾斜。