GeminiGoogleAI

Gemini 3.7 Flash 突袭!谷歌AI紧急换帅后的首个大动作,内斗真相浮出水面

冬梅··原文链接
收录于 2026/8/15 15:40:50

事件背景:换帅后八天的突袭

2026 年 8 月 5 日,Google DeepMind 完成近年来最剧烈的权力重组:

  • Demis Hassabis 卸任 CEO,转任董事长和 Alphabet 首席科学家,聚焦 AGI 与长期研究
  • Koray Kavukcuoglu(原 CTO、Alphabet 首席 AI 架构师)升任高级副总裁,接管 Gemini 模型研发、Frontier AI 研究、Gemini App 和开发者团队,直接向 Pichai 汇报,拥有重大决策最终决定权

八天后(8 月 13 日),Gemini 3.7 Flash 发布。距上一代 3.6 Flash 仅三周——谷歌自称这是基于开发者反馈和算法创新的快速迭代。

三周迭代一次:重点压在 Coding 和 Agent

大模型竞争重心已从聊天/知识问答转向代码生成、工具调用、Computer Use 和长链条 Agent 任务。3.7 Flash 集中攻击谷歌最需要补强的区域:

代码能力:

Benchmark3.6 Flash3.7 Flash
FrontierCode 1.1 Main34.4%43.6%
DeepSWE v1.1~49%65.3%
WebDev Arena (Elo)15381588

FrontierCode 1.1 基准测试对比

DeepSWE v1.1 基准测试对比

WebDev Arena 基准测试对比

Agent 执行能力:

Benchmark3.6 Flash3.7 Flash
Terminal-bench 2.178.0%85.8%
Terminal-bench 3.05.4%14.9%
AutomationBench17.0%30.4%
OSWorld 2.0 (Computer Use)33.8%47.9%

Agent 基准测试对比

OSWorld Computer Use 基准测试对比

谷歌特别强调:3.7 Flash 在遇到执行障碍时会更主动调整策略,必要时澄清用户意图,更严格遵循指令——模型在多步骤规划和工具调用中"投入更多思考",减少人工监督和重试。目标很现实:模型不能只"第一次回答得不错",需要把任务彻底完成

Flash 开始逼近旗舰模型

3.7 Flash 与高价旗舰模型的性能差距正在缩小:

  • Artificial Analysis Intelligence Index:3.7 Flash = 56,Claude Sonnet 5 = 55,GPT-5.6 Terra = 57
  • FrontierCode 1.1:3.7 Flash 的 43.6% 高于 Claude Sonnet 5(42.7%)和 GPT-5.6 Terra(41.3%)
  • WebDev Code Arena:3.7 Flash Elo 1588,高于 Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2

但旗舰模型在部分领域仍有优势:DeepSWE v1.1 中 GPT-5.6 Terra 达 69.6%,Terminal-bench 3.0 为 20.8%(vs 3.7 Flash 的 14.9%)。

谷歌对 Flash 的定位清晰:不需要所有 Benchmark 第一,而是用接近前沿的能力 + 更低价格 + 更高吞吐,成为真正能大规模跑 Agent 的 "workhorse model"

Agent 成本战:价格砍半

介绍期价格(至 2026 年 12 月 31 日):

  • 输入:0.75 美元 / 百万 Token(3.6 Flash 最初价格的一半)
  • 输出:3.75 美元 / 百万 Token

2027 年 1 月 1 日起恢复至输入 1.5 美元、输出 7.5 美元 / 百万 Token。

Gemini 3.7 Flash 定价

这一定价策略反映了 Agent 时代的成本结构变化:聊天机器人调用模型一两次,但一个真正工作的 Agent 需要规划任务、搜索资料、读十几个文件、调用多个工具、失败后重试——Token 和工具调用次数会迅速膨胀。谁能以最低成本让足够聪明的模型运行几十步甚至几百步,才是杀出重围的关键。

即日部署:进入谷歌自己的 Agent 产品

3.7 Flash 发布当天即部署到 Gemini Spark(谷歌 I/O 推出的个人 AI Agent,24 小时持续运行,覆盖 160+ 国家/地区),处理 Google Workspace 工具调用,场景包括整合多个文件、起草邮件、更新项目状态文档。

开发者可通过 Gemini API、Google AI Studio、Android Studio、Google Antigravity 使用;企业用户可通过 Gemini Enterprise Agent Platform 调用。

值得注意:Gemini 3.5 Pro 至今未正式发布。7 月 21 日谷歌称"与合作伙伴测试中",但 3.7 Flash 发布时仍无 Pro 时间表。路透指出这次发布没提供任何旗舰 Pro 模型的消息。

"内斗"真相:四组矛盾同时爆发

路透披露,这次重组并非简单高管恩怨,而是几组长期矛盾同时爆发:

1. 科研 vs 商业化 Sergey Brin 在 4 月数百人内部会议上要求 DeepMind "加快速度"。8 月,原计划的新一代旗舰 Gemini 已推迟约两个月,内部测试显示代码能力落后于竞争对手。

2. 伦敦 vs 硅谷 Koray 去年从伦敦迁往 Mountain View 总部。一些伦敦团队负责人感受到自己对 Gemini 技术路线影响力下降。Hassabis 更偏科研/AGI,Koray 更接近产品与商业化体系——他此前就是 DeepMind 与 Google Cloud 的主要接口。

DeepMind 重组内幕

3. Gemini 多位负责人意见分歧 + 算力分配 Gemini 项目长期存在多位负责人之间的意见分歧,加上计算资源受限,使一些后来证明非常重要的方向(包括 Coding)没有及时获得足够资源。Google Cloud 与 DeepMind 之间围绕 TPU 算力分配也存在紧张关系。

4. DeepMind 独立性"特权"终结 X 网友评论:

"DeepMind 能保持独立,说到底只是太平日子里的'特权'罢了。Alphabet 一慌,2014 年的协议直接作废,布林亲自下场开全员会。"

X 网友评论 DeepMind 独立性

核心人才流失:Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 离职创建 Discovery Loop(Jeff Dean 和 Oriol Vinyals 都曾是 Gemini 最初的技术联合负责人)。Noam Shazeer 转投 OpenAI,AlphaFold 核心研究者 John Jumper 加入 Anthropic。过去由大量明星研究者共同推动的 Gemini,正在变成权力更集中的项目。

Koray 时代的第一声枪响

3.7 Flash 几乎精准对应了重组后 DeepMind 最关心的问题:更快发布、更强 Coding、更强 Agent、更低成本、更直接进入产品和商业场景。

  • Hassabis 时代标签:AlphaGo、AlphaFold、科学突破、AGI
  • Koray 时代问题:Gemini 能不能更快迭代?能不能把 Coding 抢回来?能不能真正跑进 Agent?能不能把 TPU + Cloud + Workspace + Android + Gemini 用户规模组织成统一商业机器?

3.7 Flash 回答不了所有问题。迟迟未亮相的 Gemini 3.5 Pro 依然是判断谷歌是否真正重回前沿的更关键考试。但信号已经很明显:换帅后的 DeepMind,首先选择了提速。

参考链接

Zero 的看法

从工程视角看,3.7 Flash 的发布策略比模型本身更值得关注。三周迭代周期 + 价格砍半 + 即日部署到自家 Agent 产品——这不是常规模型升级,而是典型的"抢节奏"操作。谷歌显然在补 Agent 工程化的课。

几个关键信号值得前端/工程化视角解读:

1. Workhorse model 定位 = Agent 基础设施思维。 谷歌不再追求 Flash 在所有 Benchmark 第一,而是让它成为"能大规模跑 Agent 的马"。这对应工程现实:Agent 场景下单次调用成本低比单次精度高更重要,因为 Token 消耗是 O(n) 甚至是 O(n²) 增长的(规划→执行→失败重试→再规划)。0.75 美元/百万 Token 的介绍价是在抢开发者心智。

2. Coding + Agent 聚焦 = 承认战略失误。 路透披露 Coding 方向"没有及时获得足够资源",这在工程层面意味着谷歌在 Agent 工程化上错失了窗口期。3.7 Flash 的 Terminal-bench 3.0 从 5.4% 到 14.9% 看似大幅提升,但绝对值仍然很低——说明长链条 Agent 的可靠性仍是行业性难题,不是一次迭代能解决的。

3. 旗舰 Pro 缺席 = 真正的隐忧。 Flash 逼近旗舰只是叙事技巧。真正的前沿竞争(DeepSWE、Terminal-bench 3.0)仍由 GPT-5.6 Terra 主导。3.5 Pro 迟迟不发布,要么是技术没ready,要么是资源被重新分配给快速迭代——无论哪种,都说明谷歌内部还在"补课"而非"领跑"。

4. 人才流失是最大风险。 Jeff Dean、Oriol Vinyals 这些 Gemini 技术联创离开,对项目的工程连续性影响远大于管理层换帅。模型研发是有深度技术债的领域,核心架构师离职意味着大量隐性知识流失。Koray 的产品化能力能否弥补这个缺口,还需观察。

结论:3.7 Flash 是个务实的工程决策,但还不足以改变竞争格局。真正的试金石是 3.5 Pro 何时以什么水准亮相。在那之前,谷歌 AI 的"提速"更像是在追赶而非领跑。

评分:
暂无0 人评分)