谷歌此次Gemini更新凑数翻车,暴露AI竞争下谷歌的战略困境,折射当前全球AI行业竞争格局变化。 ## 1. 谷歌本次Gemini更新概况 谷歌未发布万众期待的Gemini 3.5 Pro,仅推出三款迭代模型:Gemini 3.5 Flash-Lite跑分提升显著,定价输入0.3美元、输出2.5美元/百万token;Gemini 3.5 Flash Cyber漏洞挖掘能力优于竞品,但仅对特定对象开放试点;Gemini 3.6 Flash价格降至输出7.5美元/百万token,token消耗最高可省65%,但因生成代码错误率高、性价比差被差评。 ## 2. 仓促发布问题模型的核心原因 谷歌已将大部分算力调配给Gemini 4的预训练,原定旗舰Gemini 3.5 Pro因编码能力不达标迟迟无法发布,竞品接连上新抢占市场,谷歌需要更新证明自身未停滞,只能将测试分支模型拿出来凑数。恰逢谷歌Q2财报发布,谷歌云需要低价低token消耗模型参与价格战,研发被迫采用极端剪枝压缩方案,牺牲了复杂任务的模型效果。 ## 3. 谷歌AI业务凸显大企业病 原Google Brain与DeepMind合并后内斗仍存,3.6 Flash暴露出不同团队沟通不足,特征向量存在语义鸿沟,且无人愿意为问题负责。谷歌受创新者窘境束缚,核心搜索广告业务担忧AI Agent替代搜索入口切断广告收入,战略上不敢全力推进可接管UI的AI能力,导致商业执行速度远落后于技术能力。 ## 4. 当前AI行业与谷歌的转型挑战 全球AI竞赛重心已从卷参数跑分转向卷效率与单位成本,针对高价值场景单独调优的打法会被更多企业复制,全行业AI叙事已转向“模型能否赚钱”。谷歌握有算力基建、分发渠道的护城河,但目前发布节奏混乱,面临旗舰缺位、人才流失的问题,能否完成从搜索巨头到AI基础设施巨头的转型,将决定其未来十年的行业地位。
谷歌非常焦虑
2026-07-22 21:27

谷歌非常焦虑

本文来自微信公众号: 格隆 ,作者:万连山


Gemini似乎渐渐变成了大号豆包。


昨夜,万众期待的Gemini 3.5 Pro没来,谷歌却端上来三道配菜。


Gemini 3.5 Flash-Lite。


定位高吞吐、低延迟,速度跑到每秒350个token,输入0.3美元、输出2.5美元/百万token。


跟3月发布的3.1 Flash-Lite比,Terminal-Bench 2.1从31%上升到54%,长文本理解基准GDM-MRCR v2从60.1%拉到72.2%,真实任务执行力GDPval-AA v2更是从642飙到1140。


跑分非常好看。


Gemini 3.5 Flash Cyber。


据DeepMind拿Chrome的V8 JavaScript引擎当靶子测试,用“一个问题连问5遍取交集”的多智能体套路,Cyber找出了55个独立确认漏洞,比3.5 Flash(47个)和Claude Opus 4.6(36个)都要多,其中10个是别的模型完全没揪出来的。


不过这款目前只对政府机构和“受信任合作伙伴”开放试点,普通用户用不了。


Gemini 3.6 Flash。


相比3.5 Flash,在Artificial Analysis Index测量下少用17%的输出token,在DeepSWE基准上,token消耗甚至能省到65%。


硬指标上也往上走了一截:SWE-Bench Pro从55.1%涨到58.7%,MLE-Bench从49.7%提升到63.9%,OSWorld-Verified从78.4%提到83.0%,GDPval-AA v2从1349涨到1421。


价格也降了一些:每百万输出token从9美元砍到7.5美元,输入维持1.5美元不变,还带上下文缓存读取(0.15美元/百万token)。



总之,听上去感觉都还不错。


但是,三者的风评却完全不对称。


Flash-Lite被公认是真升级,Cyber走专业路线没什么争议,本该挑大梁的3.6 Flash,却被大量差评淹没。


这个评价有些过分了。


但有一点不得不承认:谷歌正被架在火上烤。


01


这次雷声大雨点小的发布会,是当下AI竞赛的一个缩影。


行业确实形成了新的共识:重心从“卷参数、卷跑分”转向“卷效率、卷单位成本”,用更少的算力干等量甚至更多的活。


3.6 Flash和Flash-Lite主打的token效率提升、推理步骤精简,本质上是几乎所有大厂都在做的事。


Flash Cyber针对具体高价值场景(比如网络安全漏洞挖掘)单独调优、用多智能体协作把成本摊薄。


这种打法部署更快、成本更低,未来大概率也会被更多企业复制。


但也不能因为这样,就完全忽视了模型能力的升级。


所以,3.6 Flash到底是什么鬼?


为了强行降低输出Token的成本,谷歌极大概率在后训练和RLHF阶段,粗暴地剪枝了模型生成冗余结构标签的倾向。


结果就是,模型直接省略了必要的包裹层和样式重置代码。


你以为它变快了,其实是变傻了。


据昨夜多位知名开发者的连夜测试数据,3.6 Flash在生成带有超过3个层级嵌套的React/Vue组件时,标签闭合错误率高达42%。


Artificial Analysis给出的智能指数上,3.6 Flash只拿了50分,跟3.5 Flash完全打平,排在Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra一大票对手后面;反倒是Flash-Lite涨了11分。


虽然价格降了一点,但有人算了账,它每token的使用成本比GPT-5.6 Sol medium还贵,智能程度却更低。


flash模型的特点就是性价比,你这又贵又笨是怎么回事?


这就很尴尬。



按理说,谷歌这种巨头,内部测试流程极其严格,为什么会发布这样一个有明显缺陷的新模型?


最核心的原因,谷歌官方可能已经说出来了:


我们已经开始了迄今为止最雄心勃勃的预训练任务,Gemini 4。


翻译一下就是,算力全部调去跑Gemini 4的预训练了。


彭博社援爆料的信息,3.5 Pro内部测试没能达到既定目标,短板主要集中在编码能力上,迟迟达不到发布标准。


谷歌6月底曾专门针对性更新训练数据想补齐编码短板,结果效果不尽如人意。


而与此同时,对手一点没闲着:OpenAI已经发布GPT-5.5并开始推送GPT-5.6,还官宣给付费用户重置使用额度;Anthropic则接连推出Claude Opus 4.8、Claude Sonnet 5,并扩大了Fable 5的开放范围。


自家旗舰迟迟不来,对手却接连上新抢占市场,谷歌总得拿出点动静证明自己没有躺平。


只能把原本只是测试分支的3.6 Flash和Lite版本拿出来凑数。



其次,财报的压力。


谷歌今晚就要交出Q2财报,市场预期营收1169亿美元、每股收益2.90美元,Cloud业务增速预计在64%左右。


真正左右市场方向的,是云业务增长曲线和管理层有没有给3.5 Pro一个更靠谱的时间表,而不是用户对3.6 Flash的吐槽热度。


之前的Grok 4.5发布时,我们已经讨论过。


目前,AI行业的叙事逻辑已经发生了巨大变化。


模型有多强不再是唯一的指标,更重要的是能不能赚钱。


谷歌云的销售团队,需要更便宜、速度更快、Token消耗更少的模型,去跟微软Azure和AWS打价格战。


为了实现降本目标,研发团队被迫使用了极端的多专家混合网络路由剪枝策略和高损的KV Cache压缩。


结果就是,前端生成和空间推理这种需要高度注意力机制的全量在线复杂任务,成为了成本优化的牺牲品。


所以,尽管在用户社区上骂声一片,但摩根士丹利、摩根大通、高盛等机构依然维持看多评级,理由是谷歌在算力基建、Cloud和Workspace分发渠道上的护城河依然坚固。


昨夜,谷歌股价仅仅微跌1.38%,也远不及前几周因人才和跳票消息造成的暴跌。


目前的真实情况是:谷歌不是没有牌可打了,而是打法太乱。


一手基建和分发的好牌,但旗舰迟迟不到位、核心人才不断被挖角、发布节奏被对手牵着鼻子走的窘境,凑在一起显得格外拧巴。


02


Gemini 3.6flash这次发布即被群嘲,只是谷歌今年AI故事里的一个小插曲。


它的大企业病症状,已经明显成为竞争中的障碍。


至少表现在两个方面。


第一,内斗不断。


虽然早在几年前谷歌就将Google Brain和DeepMind合并为了Google DeepMind,但强扭的瓜根本不甜。


3.6flash就是个典型的例子。


模型底层优秀的Token吞吐能力,显然是底层工程团队(原Brain系)优化的功劳;而极度糟糕的视觉-空间融合,暴露了多模态训练团队在资源争夺上的失败。


负责模型基座的团队和负责多模态视觉微调的团队,似乎根本没有好好沟通。


导致视觉Encoder传过来的特征向量,跟语言大模型的输入空间之间,存在着巨大的语义鸿沟。


更糟糕的是,没人愿意为之负责,所有人都只想完成任务赶紧交差。


谷歌AI团队结构


第二,创新者窘境。


即我们常说的船大难掉头。


归根结底,谷歌所有的AI动作,都笼罩在保护其万亿市值基石——搜索广告业务的阴影下。


比如,为什么Gemini始终在Agent操作UI这件事上显得畏手畏脚?


因为如果一个AI能够完美地理解网页结构,帮你买东西、帮你查资料,谁还会去看谷歌搜索结果页面上的广告?


这根本就不是技术上的问题,而是战略上无法让AI接管UI。


Google Search一年创造数千亿美元广告收入。


任何AI战略都必须考虑,“如果AI替代搜索,会不会砍掉自己的利润?”


这是非常现实的问题。


谷歌确实需要AI成为一个强大的辅助工具(所以它推GitHub Copilot接入、推文档处理工具),但它更恐惧能够完全替代用户浏览网页的Agent。


过去,谷歌拥有搜索入口、Android入口、浏览器入口、YouTube入口、云入口,是全球互联网最豪华的生态。


如果AI真的成为下一代入口,谷歌最大的恐惧不是输掉一个模型,而是输掉下一代计算入口。


所以我们最终看到的结果:


谷歌明明拥有最顶级的研究能力,商业执行速度却总是慢一拍。


可惜,时间不等人。


此时此刻,OpenAI在下注,Anthropic在下注,开源社区在下注,中国AI公司也在下注……


几年之内,互联网行业很可能迎来前所未有的重新洗牌。


而谷歌能不能完成从“搜索巨头”到“AI基础设施巨头”的转型,将决定它未来十年的生态位。

AI原生产品日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP