你让 AI 帮公司改一段代码、查几份文件,再把结果写进邮件。它不只要答对,还得响应快、少返工,并且经得起成千上万次调用。Gemini 3.7 Flash 瞄准的正是这类日常重活:它不是谷歌用来冲击能力上限的顶级型号,而是强调速度、吞吐量和成本的“主力工作模型”。
谷歌此时先更新 Flash,也让产品节奏比单次跑分更值得看。据 Bloomberg 报道,谷歌推出新 Flash 时,顶级 AI 模型仍在推迟;现有材料没有披露具体延期对象、原因或时间。关于 3.7 Flash 的性能、价格和上线范围,以下信息主要来自 Google DeepMind 官方发布稿,尚缺乏独立复核。
三周一更,先把主力型号推上去
Google 将 Gemini 3.7 Flash 定位为面向编程和智能体的 Flash 系列模型。智能体(Agent)不是只回答问题的聊天机器人,而是能分步骤规划、调用工具并执行任务的系统。比如,它可以读取文件、起草邮件,再更新项目状态。
按 Google 官方说法,3.7 Flash 距 Gemini 3.6 Flash 发布只有三周。这个间隔很短。Google 将快速迭代归因于开发者反馈和算法改进,并称部分改进还会用于未来模型,但没有公开具体技术方法。
这条产品线看重的不只是“最难题能不能答对”。延迟是一次请求需要等多久;吞吐量是系统在单位时间内能处理多少请求或 Token。Token 是模型处理文字时使用的基本计量单位,可以粗略理解为被切分后的文字片段。对线上客服、编程助手和自动化流程来说,响应速度、并发能力和单次成本,往往与极限能力同样重要。
跑分涨了,但都是官方成绩
Google 公布的几组测试显示,3.7 Flash 相比 3.6 Flash 有明显提升。
在软件工程测试 FrontierCode 1.1 Main 上,得分从 34.4% 升至 43.6%;在 DeepSWE v1.1 上,则从 49.0% 升至 65.3%。这些测试试图衡量模型处理调试、修复问题等编程任务的能力。Google 还称,新模型首次生成代码的准确性更高,但没有提供独立验证结果。
网页开发方面,Arena.ai WebDev Arena 的 Elo 评分从 1538 升至 1588。Elo 是一种根据对比结果动态计算的排名分数,数值会随参与模型和评测样本变化,不能当作固定不变的能力刻度。
在复杂文档测试 GDP.pdf benchmark 上,得分从 22.0% 升至 34.0%;在衡量现实商业流程的 AutomationBench 上,则从 17.0% 升至 30.4%。这两项结果与智能体场景直接相关:模型不仅要读懂材料,还要把多个步骤串起来完成任务。
不过,这些数字均由 Google 发布。现有材料没有说明完整测试配置、推理预算和比较条件。官方所说的“更少人工监督和重试”,也应视为产品主张,而不是已经得到外部验证的结论。
价格也是这次更新的一部分
3.7 Flash 在年底前采用推广价:每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。输入 Token 是用户交给模型阅读的内容,输出 Token 是模型生成的内容。Google 称,这约为 3.6 Flash 原始每百万 Token 价格的一半。
这项价格只承诺持续到年底,不能视为长期定价。但它清楚说明了谷歌的策略:先用更低调用成本,把新模型推入需要频繁运行的编程工具和智能体服务。模型每次便宜一点,在每天调用数百万次的产品里就可能变成显著差异。
Gemini Spark 也从发布日起改用 3.7 Flash。Spark 是 Google 面向个人用户的常驻智能体,可在用户指示下整理文件、起草邮件和更新状态文档。目前它覆盖 160 多个国家的 Google AI Pro 和 Ultra 订阅者。Google 还表示,新模型更新了针对化学、生物、放射、核相关风险及网络攻击滥用的防护措施。
真正值得看的是发布顺序
我们此前报道过,Google 在 8 月 7 日把 Gemini 模型、应用和开发者团队统一交由 Koray Kavukcuoglu 管理,意在缩短研究到产品的链路。六天后亮相的 3.7 Flash,提供了一个观察新架构的早期切面:谷歌先推进可以快速进入 API、企业平台和个人智能体的效率型模型。
与此同时,顶级型号仍未登场。前沿模型指能力接近当前技术边界、训练和运行成本通常也更高的模型。谷歌此刻先打速度和成本牌,并不等于前沿竞争已经分出结果;它更像是在等待顶级产品的同时,先争夺开发者调用量和真实工作流。
局限与未知
- Google 没有披露 3.7 Flash 的模型结构、训练方法及“三周迭代”具体改了什么。
- 各项性能数据来自官方,可能受测试选择、推理预算和未公开配置影响。
- Bloomberg 仅能支持“顶级型号仍在推迟”这一概括,现有材料不足以判断延期对象、原因和新时间表。