Arena Mirror (China)
返回文章列表
分享:

Gemini 3.7 Flash 上线与 3.5 Pro 难产之谜:榜单实测、人事地震与 Gemini 4 决战

在距离 Gemini 3.6 Flash 上线仅仅过去三周之际,Google 再次出人意料地火速推出了 Gemini 3.7 Flash。然而,与轻量级模型的密集迭代形成鲜明对比的是:曾经被寄予厚望的旗舰模型 Gemini 3.5 Pro,至今依然“遥遥无期”。

  1. 承诺周期(2026 年 5 月):Google I/O 大会公开承诺:“Gemini 3.5 Pro 下月(6月)正式推送”。
  2. 现实窘境(6月~8月):6月、7月已过,8月中旬迎来的却是 3.6 与 3.7 Flash 的连续填补。
  3. 核心现状(当前战局):旗舰 Pro 遭遇技术与对齐难产,前线只能依靠轻量级 Flash 苦撑门面。

那么,开启了最高思考模式(High)的 Gemini 3.7 Flash,究竟交出了一份怎样的战报?跳票数月的 3.5 Pro 背后究竟发生了什么?这场危机又如何引爆了 Google 近年来最剧烈的高层人事地震?


一、 榜单实测:Flash 的极限突围与断层天花板

根据 LMSYS Chatbot Arena 以及 Artificial Analysis 同步公布的最新评测数据,开启高推理算力(high)的 Gemini 3.7 Flash 确实展现出了作为轻量级模型的惊人战力,成功挤入全球第一梯队,但同时也清晰暴露了它与顶级超大旗舰之间的硬实力差距。

1. LMSYS 文本对话榜:位列全球第 9,跻身头部梯队

LMSYS 文本对话榜单:Gemini 3.7 Flash High 排名第 9,Elo 1490 分

在考察通用对话与跨领域综合推理能力的 LMSYS 文本对话榜中:

  • 实测表现:开启高推理算力(high)的 Gemini 3.7 Flash 斩获 1490 分,位列全球第 9 名
  • 同台对抗:与阿里巴巴的 qwen3.8-max(1491 分)、Anthropic 的 claude-opus-5-max(1489 分)处于同一对抗区间;
  • 头名差距:落后榜首的 claude-fable-5(1506 分)16 分

2. LMSYS 前端开发榜:与顶级代码旗舰存在明显代差

LMSYS 前端开发榜单:Gemini 3.7 Flash High 排名第 8,Elo 1588 分

在考验真实前端代码构建与 UI 还原交付的 LMSYS 前端开发榜中:

  • 实测表现:Gemini 3.7 Flash 以 1588 分 位列全球第 8 名
  • 局部表现:小幅领先智谱 glm-5.2-max(1587 分)与深度求索 deepseek-v4-flash-high(1582 分);
  • 明显代差:落后榜首的 claude-opus-5-max(1691 分)高达 103 分,与第二梯队的 kimi-k3-max(1674 分)、gpt-5.6-sol(1622 分)也有 30~80 分的差距,在处理复杂软件工程任务时依然存在瓶颈。

3. Artificial Analysis 综合智能指数:代际跨越与梯队定位

Artificial Analysis 综合智能指数(2026年8月13日):Gemini 3.7 Flash High 综合指数 56 分

在综合 9 项前沿复杂基准(涵盖 Terminal-Bench、GPQA、Humanity's Last Exam 等)的 Artificial Analysis 综合智能指数中:

  • 实测表现:Gemini 3.7 Flash 综合指数达到 56 分,位列全球第 9 名
  • 代际跨越:相比上一代 Gemini 3.5 Flash-Lite(37 分)实现了大幅跃升;
  • 头名差距:距离第一名 Claude Opus 5(63 分)落后 7 分

阶段小结:轻量级的极限与战略真空
榜单实测数据清晰地表明:Gemini 3.7 Flash 已经把轻量级架构的推理性价比发挥到了极致,在通用对话与标准化基准中表现出色;但它无法替代全血旗舰(Pro / Ultra)在极难软件工程与 Agent 规划任务上的统治力
当竞品纷纷拿出 Opus 5、GPT-5.6 Sol 等重型旗舰在代码高地上攻城略地时,Google 手中却只有 Flash 牌苦撑战线——这种绝对制高点上的缺位,正是 Google 内部当前最大焦虑的直接来源。


二、 旗舰失踪之谜:Gemini 3.5 Pro 为何深陷难产?

如果说 Flash 凭借极致的推理性价比还在苦苦维持战线,那么 Gemini 3.5 Pro 的“隐身” 则直接戳中了 Google 内部最敏感的神经。

从 2026 年 5 月 Google I/O 大会上高调承诺的“已在内部广泛使用,下月(6月)正式推送”,到如今 8 月中旬依然杳无音讯,这场长达数月的跳票背后,绝非简单的“排期微调”,而是一场深层次的技术攻坚失利与内部机制博弈。

1. 核心死穴:Agentic Coding(智能体编程)表现未达预期

在大模型全面迈入智能体(Agent)时代的背景下,代码能力早已不再是单纯的“函数补全”,而是衡量模型自主拆解复杂逻辑、跨仓库重构以及环境交互的最核心试金石。然而,这恰恰成了 3.5 Pro 的重灾区。

  • 内部评测的“滑铁卢”:据彭博社等多家权威科技媒体披露,3.5 Pro 在内部严苛的软件工程与自动化基准(如复杂代码库 Debug、长时程 Agent 规划)测试中,表现始终无法达到对标竞品(如 Anthropic 的 Claude Opus 5 系列与 OpenAI 的 GPT-5 系列)的基线标准。
  • 回炉重造后的再次失望:为了挽救代码短板,研发团队在 6 月下旬曾紧急重构并注入了新的微调与强化学习训练集。然而,重新评估的结果依然未见质的突破。在无法确保对同代旗舰形成压制的情况下,强行发版只会让 Google 陷入巨大的公关与技术信任危机。
  1. 5 月 I/O 大会承诺发版:内部多轮严苛评估未达标,Coding 与 Agentic 规划差距明显。
  2. 6 月下旬紧急重构重训:注入全新代码微调与强化学习(RL)数据集。
  3. 7 月全面复测评估:依然未见质的突破,无法确保压制同代旗舰。
  4. 8 月被迫继续推迟:避免贸然发版引发公关与技术信任危机,选择雪藏。

2. 数据的结构性劣势:缺乏高频开发者原生闭环

对于代码与智能体能力的落后,Google CEO Sundar Pichai 曾在内部与公开场合坦承:Google 在 Agentic Coding 领域确实“落后于前沿(a bit behind the frontier)”

这暴露出 Google 在数据飞轮上的深层软肋:

  • 缺少高粘性的原生开发产品:竞品凭借高频的开发者工具(如直接面向开发者的原生代码编辑生态、交互式 Artifacts)沉淀了海量真实的跨文件修改、Debug 试错与多轮反馈数据。
  • 数据养料贫瘠:由于缺乏类似的高粘性闭环产品,Google 在用于强化学习(RLHF / RLAIF)的高质量真实开发者交互数据上处于天然劣势,导致模型在处理真实工业级代码场景时显得生硬且容易迷失上下文。

3. “军阀割据”:内部部门博弈与资源分散

除了纯算法层面的挑战,Google 庞大官僚体系下的组织内耗也是拖慢 3.5 Pro 的罪魁祸首:

  • 主导权之争:在 Google 内部,Google DeepMind、Google Cloud、Android 以及开发者生态团队 都在试图主导自家的 AI 编程与 Agent 工具链,各自立项、互相争夺 TPU 算力与工程资源。
  • 技术栈与目标冲突:云业务部门急于将模型封装为企业级 API 变现,而 DeepMind 的研究员则执着于前沿理论验证与学术纯洁性,导致产品定义反复摇摆,沟通与决策链路被无限拉长。

4. 巨头的对齐包袱:宁可跳票,不可犯错

初创公司可以“小步快跑、上线再修”,但 Google 的旗舰基座一旦正式打上“Pro”标签,必须立刻承接全球十亿级 Android 终端、Workspace 办公套件以及全球财富 500 强企业的核心工作流。

  • 严苛的红队与合规压力:极高的安全审核、事实校验(Grounding)与反幻觉标准,使得任何处于及格线边缘的模型版本都会被安全委员会直接打回。
  • 商业防守的被动:在没有绝对胜算超越竞品顶配旗舰之前,贸然发布一个处于下风的 3.5 Pro,不仅无法提振股价,反而会削弱企业客户对 Google 云生态的信心。这最终促使管理层做出了“按住 Pro 不发,靠 Flash 连环换代顶住战线”的妥协决策。

阶段小结
Gemini 3.5 Pro 的难产,是技术瓶颈、数据短板、部门内耗与大厂包袱共同催生的恶果。而正是这种旗舰难产带来的巨大危机感,直接引爆了 8 月初 Google 核心管理层的“人事大地震”。


三、 8月人事大地震:从“学术象牙塔”到“战时交付兵工厂”

旗舰基座 3.5 Pro 的难产与延期,不仅让 Google 在大模型竞争中倍感被动,更直接引爆了 Google 内部多年未见的高层人事海啸与权力洗牌。

2026 年 8 月 5 日,Google 母公司 Alphabet CEO Sundar Pichai 发布内部全员信,正式宣布了针对 AI 核心领导层的重大架构重组。这场调整彻底撕下了温和过渡的表象,宣告了 Google AI 战略的全面转向。

阵营派系 核心人物与变动 核心去向与权责变化
学术与科研探索派
(老将出走 / 退居幕后)
Jeff Dean(效力 27 年灵魂元老)
Sanjay Ghemawat(Google Senior Fellow)
Quoc Le / Oriol Vinyals(核心技术骨干)
离开 Google,四人联合创立专注于 AI 自动化科研实验的初创公司 Discovery Loop
Demis Hassabis(DeepMind 联合创始人) 卸任 DeepMind CEO 日常运营管理,转任 董事长兼 Alphabet 首席科学家,退居宏观战略
战时工程交付派
(实权统揽 / 硅谷中枢)
Koray Kavukcuoglu
(原 DeepMind CTO / 首席 AI 架构师)
升任 Google DeepMind SVP,直接向 CEO Sundar Pichai 汇报,独揽 Gemini 研发、产品与开发者生态全权

1. 核心震荡:元老出走、统帅退位与铁腕接盘

① 27 年灵魂元老谢幕:Jeff Dean 携核心天团离职

  • 事件:Google 第 30 号员工、现代分布式系统与深度学习基石的奠基人 Jeff Dean 正式离开效力 27 年的 Google。
  • 带走的核心班底:包括其数十年的黄金搭档 Sanjay Ghemawat(Google Senior Fellow)、Quoc Le(Google Brain 联合创始人、AutoML 先驱)以及 Oriol Vinyals(原 DeepMind 研究副总裁兼 Gemini 核心技术负责人)。
  • 去向:四人联合创立专注于利用 AI 自动化科学与工程实验循环的初创公司 Discovery Loop(Google 仅作为早期投资人与云算力伙伴参与)。

② Demis Hassabis 卸任 CEO,退居宏观幕后

  • DeepMind 联合创始人兼 CEO、诺贝尔化学奖得主 Demis Hassabis 正式卸任 Google DeepMind 的日常运营与行政管理职务。
  • 转任 Google DeepMind 董事长(Chair)Alphabet 首席科学家,并将主要精力转向宏观 AGI 战略、全球 AI 治理政策以及其亲自创立的 AI 制药公司 Isomorphic Labs

③ Koray Kavukcuoglu 实权统揽:全面接管一线指挥权

  • 原 DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu 升任 Google DeepMind 高级副总裁(SVP),直接向 Sundar Pichai 汇报
  • 一人全面统领 Gemini 基座模型开发、前沿 AI 研究、Gemini App 消费端以及开发者平台生态 的全部核心团队。

2. 深度剖析:人事风暴背后的终极焦虑

这一连串标志性的人物进退,深刻映射了 Google 在当前大模型战局下的三个底层逻辑变化:

① 烧钱压力与发版滞后的双重夹击

Google 2026 年的全年资本支出(CapEx)预计高达 1,950 亿至 2,050 亿美元,绝大部分砸向了庞大的 TPU/GPU 算力基础设施与数据中心。然而,与天文数字般的投入形成残酷对比的,是旗舰 3.5 Pro 的难产与 Coding 智能体能力的掉队。面对华尔街与董事会的严苛审视,管理层必须迅速给出交代并重构执行链路。

② 终结“学术浪漫主义”,全面转向“战时工程交付”

  • 旧模式的局限:过去的 Google Brain 与 DeepMind 享有极高的学术自由度,研究员习惯于以攻克科学难题、发表顶级论文为导向(如 AlphaGo、AlphaFold),发版周期漫长且对商业落地缺乏紧迫感。
  • 新模式的铁律:面对对手“以月为单位”的狂暴工程迭代,Google 已经没有时间等待漫长的学术探索。由具备极强工程落地能力的 Koray 掌权,标志着 Google 彻底终结了实验室文化,全面转入以“产品交付、版本迭代、商业防守”为绝对优先级的工业化战时状态

③ 破除“双轨制”内耗,权力彻底收归硅谷中枢

自 2023 年两部门强行合并以来,伦敦 DeepMind 团队与山景城总部之间在技术路线、算力分配、发版标准上的隔阂始终未消。此外,Hassabis 长期常驻伦敦,跨时区指挥加州一线也带来了极高的沟通成本。

随着 Google 联合创始人谢尔盖·布林(Sergey Brin)在加州总部一线高频督战,常驻山景城、深受管理层信任的 Koray 接管实权,意味着 Google 彻底理顺了内部层级,完成了对 DeepMind“独立王国”的最终收编。

阶段小结
这场人事地震并非简单的内部倾轧,而是 Google 在大模型下半场为自身臃肿体制所动的一次“刮骨疗毒”。它扫清了学术研发与工程交付之间的沟通壁垒,而重新集结完毕的战时团队,其真正的终极考验与唯一救赎,全部压在了正在秘密训练的下一代王牌——Gemini 4 之上。


四、 破局的底牌:全力押注 Gemini 4

对于当前的 Google 而言,不断推陈出新的 Flash 系列只是在前线苦撑防线,而 3.5 Pro 的难产与受阻,促使管理层放弃在修补性过渡代上继续消耗资源,将翻盘的希望直接押注在了下一代重型基座 —— Gemini 4 之上。

  • 正式开训:2026 年 7 月 21 日,Google 官方确认已正式开启 Gemini 4 的全量预训练(Pre-training)
  • 官方定调:管理层将其称为公司历史上“最具雄心、体量跃升的顶级前沿模型预训练(Most ambitious pre-training run yet)”;
  • 战略取向:在理顺高层人事与组织架构后,Google 不再将核心算力分散消耗在 3.5 Pro 这类修补性的过渡版本上,而是集中全球 TPU 算力集群,全力攻坚代际跨越的真正前沿基座。

总结

从这一系列的最新动态中,我们可以清晰地勾勒出 Google 当前的战役节奏:

  1. 战术防御:用 Gemini 3.7 Flash 这样高性价比、高响应速度的轻量模型稳住开发者生态和基本盘;
  2. 战略转型:通过剧烈的人事重组彻底终结“学术象牙塔”的拖沓内耗,全面转向“以工程交付为核心”的战时状态;
  3. 终极决战:将所有资源与翻盘胜负手,全部压在正在预训练的 Gemini 4 身上。