Gemini 3.7 Flash火速上线,谷歌被迫参与“价格战”
Gemini 3.6 Flash发布仅仅三周后,谷歌再次火速更新。
美国当地时间8月13日,谷歌推出Gemini 3.7 Flash。本次升级重点放在编程、智能体应用、Web开发以及复杂知识工作上。谷歌官方甚至直接将其定义为“迄今为止用于编码和智能体领域最智能的Flash级主力模型”。
除了模型能力的优化,谷歌也被迫启动“价格杠杆”,通过突出性价比的方式,来为模型吸引客户——2026年底之前,Gemini 3.7 Flash的API入门价格直接减半,下调至每百万Token输入0.75美元、输出3.75美元。
谷歌希望通过这种高频迭代与低价策略,让模型在复杂的多步骤任务中减少失败重试与人工干预,从而帮助开发者在真实业务场景中大幅降低部署成本。
01
编程、智能体与多模型协同
Gemini 3.7 Flash在基础规格上保持了多模态输入的优势,支持文本、图像、音频和视频输入,上下文窗口维持在100万Token,输出上限则提升至64K Token。
模型同时引入了可调整的思考配置,允许用户在不同任务中灵活权衡输出质量、推理成本和响应速度。
这次升级最核心的改变在于模型处理实际工程任务的方式。
谷歌表示,Gemini 3.7 Flash在遇到障碍时表现出了更强的自适应能力,能够主动向用户澄清意图,并更加严谨地执行具体指令。同时,通过在多步骤规划和工具调用中投入更多计算资源,降低工程工作流中的死循环重试和人工监督需求。
在实际的代码调试和复杂问题解决任务中,Gemini 3.7 Flash的生成质量比前代有了实质性飞跃,尤其是在处理长程软件工程和生产级代码时,首次通过准确率明显提升。
在Web开发领域,新模型不仅可以用更少的提示词生成功能完善的页面和复杂应用,还能精准地根据设计系统、参考图像甚至简单的界面截图,高度还原符合设计的UI界面。
对于复杂的文档理解与企业自动化工作流,新模型的推理准确性同样实现了大幅跃升。为了证明新模型的实际落地能力,谷歌在发布现场展示了多个覆盖不同领域的实际案例:
第一个案例是从简单文本生成3D游戏。开发者只需输入一段简单的文本提示,Gemini 3.7 Flash就能即时构建出可玩的3D游戏框架,并与Nano Banana模型协同,实时动态生成游戏中的角色、道具和表面纹理。
第二个案例是单次生成交互式落地页。Gemini 3.7 Flash可以作为主控模型来协调多个子智能体,同时调用Gemini Omni创建具有视差效果的动态交互组件,直接输出可运行的网页。
第三个案例是辅助机器人训练。在包含三个智能体的图循环中,Gemini 3.7 Flash利用其多模态理解能力帮助机器人进行环境感知与决策,从而显著加快机器人的学习与训练速度。
第四个案例是静态PDF动态化。模型能够直接读取一份复杂的静态年报PDF,将其自动解析并转换成包含实时图表、可交互数据和核心洞察总结的动态网页。
软件开发者@OmedVibeCodes表示,新模型在长达9分钟的测试中展现出了极高的细节捕捉能力,进步远超过去的版本。
安全研究员弗洛里安·罗特(Florian Roth)使用THOR基准测试了模型在安全事件分诊中的表现,在189个真实世界的安全发现中,Gemini 3.7 Flash实现了100%的威胁捕获率和0%的关键遗漏。更重要的是,它极大地减少了假阳性误报,避免了分析师被无效审查淹没,成为其测试过的最佳安全分诊模型。
02
跑分进阶,但未形成全面优势
从行业基准测试的整体结果来看,Gemini 3.7 Flash的提升较为集中,但并未实现对所有竞争对手的全面碾压。
在生产代码质量(FrontierCode 1.1 Main)测试中,Gemini 3.7 Flash以43.6%的得分,击败了Claude Sonnet 5(42.7%)和GPT-5.6 Terra(41.3%)。
在第三方机构Artificial Analysis的AA-AnalystAgent复杂文档与表格分析测试中,Gemini 3.7 Flash更是取得了60%的最高pass^5成绩,领先于Claude Opus 5(54%)。
同时,它在AutomationBench-AA测试中达到62.7%,也领跑于
不过,在部分极端环境中,竞品依然维持着领先优势。
比如在Artificial Analysis的长程软件工程DeepSWE v1.1中,Gemini 3.7 Flash的65.3%低于GPT-5.6 Terra的69.6%;在Terminal-bench 2.1终端编码测试中,它以85.8%稍逊于GPT-5.6 Terra的87.4%。而在Agent's Last Exam多模态桌面测试中,Claude Sonnet 5则以33.3%的通过率领先于Gemini 3.7 Flash的26.3%。
Artificial Analysis的综合测评数据显示,Gemini 3.7 Flash在高推理模式下的智能指数达到56分,比前代高出4分,与GPT-5.6 Terra(57分)极度接近。同时,其输出速度高达每秒340个Token,平均任务耗时仅1.7分钟,比GPT-5.6 Terra快了近40%。这种高速推理能力使其成功跻身“智能与完成时间”的帕累托最优前沿。
在专为网页开发、数学推理和多轮对话设立的Arena评测中,Gemini 3.7 Flash的排名同样实现了跨越式上升。
但LuminaBench等外部观察者也指出,Gemini 3.7 Flash的表现“令人失望”。他们认为,相较于3.6 Flash确有进步,但整体缺乏亮点,在多项基准测试中仍落后于Terra。谷歌急需Gemini 4拿出更有说服力的表现,当前这一版本显然不足以扭转局面。
整体来看,新模型的定位清晰:编程、网页开发、文档理解和常规智能体任务表现亮眼,但在部分高度复杂的终端环境模拟中仍存短板。
03
谷歌被迫启动“价格杠杆”
除了能力提升,价格策略是本次发布的另一个战略焦点。
在2026年12月31日之前,谷歌为开发者提供了极为优惠的促销价格:每百万输入Token仅收0.75美元,每百万输出Token仅收3.75美元。这相当于在Gemini 3.6 Flash原有标准价格的基础上直接打了五折。
到了2027年1月1日,价格将恢复至每百万输入Token 1.50美元、输出7.50美元。这意味着谷歌给市场留出了为期数月的低价窗口期。
对于开发自主智能体而言,Token的单价仅仅是综合成本的一部分。一个真实业务中的智能体任务,往往需要经历多次模型调用、工具执行与错误重试。如果模型单价便宜但频繁出错,导致程序陷入循环重试或需要人工介入,最终的运营总成本反而会更高。
谷歌本次重点强调更高的首次执行成功率和更严谨的指令遵循,正是为了直击这一痛点。
Artificial Analysis的成本测算显示,在目前的折扣价格下,Gemini 3.7 Flash在高推理模式下的单任务平均成本约0.40美元,中等推理模式下则进一步降至0.26美元。
谷歌试图证明,通过提高模型在真实代码库和业务流程中的可靠性,能够在很大程度上帮助企业真正切中降本增效的要害。
开发者@VaibhavSisinty评价称,Gemini 3.7 Flash便宜到“建一个完整网站的成本还不到一杯茶的价格”。每百万输入Token仅0.75美元,已低于目前所有中国模型。在他看来,AI价格战不是即将到来,而是已经身在其中。
发布之后,Gemini 3.7 Flash已快速接入谷歌的全线产品和开发平台。
开发者目前已经可以通过Gemini API、等渠道直接调用该模型。企业客户则可以通过Gemini Enterprise Agent Platform和Gemini Enterprise平台进行业务部署。在个人用户侧,Google AI Pro和Ultra的订阅者可以在个人AI智能体Spark中直接体验3.7 Flash。
同时,谷歌更新了针对化学、生物、放射、核风险以及网络攻击相关的防护规则。模型卡文件明确指出,Gemini 3.7 Flash的知识截止日期为2026年3月,并且依然保留了基础模型常见的幻觉问题,在高负载下同样可能出现响应延迟或超时的情况。
值得注意的是,这次发布距离Gemini 3.6 Flash仅仅过去了三周,且发生旗舰模型Gemini 3.5 Pro屡次推迟发布的大背景下。谷歌显然正在调整战术,通过加快Flash系列的更新节奏,让中端主力模型先一步扛起编程与智能体落地的重任。
不过,基准测试的数据固然漂亮,更关键的考验在于将模型放入具体的代码库、复杂的业务文档和真实的智能化流程后,能否真正减少人工干预与失败重试,并在明年的价格恢复期到来之后,依然保持合理的综合单任务成本。
本文来自微信公众号“腾讯科技”,作者:苏扬,编辑:徐青阳,36氪经授权发布。















