谷歌发布Gemini三款新Flash模型,未改善用户对Gemini能力下滑的负面印象,旗舰3.5 Pro跳票,Gemini 4仍处于画饼阶段,市场评价普遍不佳。 ## 1. 谷歌本次发布的三款新品核心信息 - **Gemini 3.6 Flash(主力定位)**:作为3.5 Flash的小迭代,主打省token,比上一代少用17%输出token,DeepSWE场景省65%,输入价1.5美元/百万token、输出7.5美元/百万token(上一代输出9美元)。代码能力DeepSWE从37%提升到49%,MLE Bench从49.7%升至63.9%,知识截止日期更新到2026年3月。 - **Gemini 3.5 Flash-Lite(高吞吐低延迟定位)**:售价白菜,输入0.3美元/百万token、输出2.5美元/百万token,支持调整推理档位,多项指标大幅提升,在SWE-Bench Pro等任务上性能反超旧款3 Flash,可做3.6 Flash的平替副手。 - **Gemini 3.5 Flash Cyber(安全专用)**:基于3.5 Flash微调,专门用于查找修复代码安全漏洞,仅对可信合作伙伴限量开放内测,官方称CyberGym基准达到第一梯队水平,比大模型更省token。 ## 2. 旗舰Gemini 3.5 Pro疑似跳票 官方仅称该模型仍在合作伙伴测试中,未明确上线时间。据彭博社等媒体报道,该模型代码生成能力未达内部预期,谷歌曾更新训练数据补短板无果,甚至有传闻推翻方案从零重训;谷歌已将宣传重点转向Gemini 4,被质疑转移视线画饼续命。 ## 3. 市场与用户对新模型评价负面 第三方评测显示,3.6 Flash智能水平对比3.5 Flash基本原地踏步,分数低于Meta、OpenAI等一众竞品,性价比低于GPT-5.6 Sol medium,冲击了Flash系列「性价比立身」的定位。 不少实测用户反馈,新模型存在中文选词错误、多模态生成不符合指令、记忆混乱、工具调用错误等问题,整体性能不升反降。 ## 4. 当前Gemini系列的整体处境 从去年开始就有网友调侃Gemini能力持续下滑,本次发布未扭转负面印象,反而引发更多吐槽。谷歌目前仅靠迭代Flash模型维持市场存在感,Gemini 4的预训练若再次翻车,能力下滑的调侃可能成真。
刚刚,Gemini3.6 Flash 正式发布,但网友笑得更大声了
2026-07-22 06:08

刚刚,Gemini3.6 Flash 正式发布,但网友笑得更大声了

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《刚刚,Gemini 3.6 Flash 正式发布,但网友笑得更大声了》


如果你从去年就开始用Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。


这是最近网友对Gemini的一句调侃。


按理说,一家公司发新模型,通常是来打脸这种调侃的。可就在刚刚,Google一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。多少有种他们都不看好你,可偏偏你最不争气的即视感。



三个模型分别是3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的3.5 Flash Cyber。官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模AI agent而生」,一句不落。


只不过,实际体感却冰火两重天。



主角登场,3.6 Flash到底强在哪


先说头牌,3.6 Flash。官方给的定位就俩字——「主力」(workhorse),干活模型。


3.5 Flash是今年5月I/O大会上发的,这次算是小版本迭代。


最大的卖点是省token。



按Artificial Analysis Index的数据,3.6 Flash比3.5 Flash少用17%的输出token,在DeepSWE(Datacurve出的基准)这类场景上甚至能省到65%。官方还说它跑多步任务时,推理步数和工具调用都更少。也就是说,干同样的活,废话更少,绕路更少,账单更薄。



价格也确实降了。输入1.5美元/百万token,输出7.5美元/百万token——注意,上一代3.5 Flash的输出是9美元,这波直接砍到7.5。又快又省,单个agent任务的成本就压下来了。



基准测试上,官方摆出了一整排数据。


代码能力是重点。DeepSWE从37%提升到49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。机器学习研究方向的MLE Bench提升更明显,从49.7%拉到了63.9%。



计算机操作(computer use)能力也有长进,OSWorld-Verified从78.4%升到83%。并且,「计算机操作」(computer use)也成了Gemini API和企业版的内置工具,主打一个开箱即用。


知识工作方面,GDPval-AA v2从1349涨到1421。Hebbia、Harvey等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。Figma、JetBrains也都出面背书了一番。


哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从2025年1月推进到了2026年3月。老黄历总算翻篇了。



安全这块,官方说3.6 Flash上了升级版的Frontier Safety防护,重点盯着CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。


·以小博大,便宜大碗的3.5 Flash-Lite也能更换推理档位了


第二个是3.5 Flash-Lite,定位比3.6 Flash还低一档,主打「快」和「便宜」,专治高吞吐、低延迟的任务,比如agent搜索、文档处理。


它是3.5系列里最快的,按Artificial Analysis的测量是每秒吐350个token。价格更是白菜——输入0.3美元、输出2.5美元每百万token。官方说质量比3月发的3.1 Flash-Lite好一大截。


有个设计挺灵活:它支持调「推理档位」。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。


跟前代比,提升相当明显:代码和agent任务的Terminal-Bench 2.1,从31%干到54%;长上下文的GDM-MRCR v2,从60.1%提到72.2%;真实任务执行的GDPval-AA v2,更是从642飙到1140。



最有意思的是,这个「小弟」在不少agent和代码任务上,居然反超了辈分更高的3 Flash。


比如SWE-Bench Pro(54.2%vs 49.6%)、OSWorld-Verified(74.0%vs 65.1%)。以小博大,属实有点东西——等于说跑3 Flash的活儿,现在有了个更快更强的平替。



官方还举了几个用法:从海量电商数据里抽产品特征、给3.6 Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp这几家客户也来夸了它「速度、智能、成本三合一」。


最后一个3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。


Google的逻辑挺有意思:现在AI找漏洞的速度,已经比现有系统修漏洞的速度快了。既然漏洞越堆越多,那干脆用便宜高效的Flash来批量补锅。


这个模型是在3.5 Flash基础上微调出来的,搭配自家的CodeMender工具用。CodeMender里跑的是好几个Flash Cyber agent,协同工作、最后汇总成一份报告。



在业内有名的CyberGym基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省token。


不过这模型我们暂时也用不上。


考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的Google也学Anthropic玩起了安全叙事。把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。


说好的3.5 Pro呢?如来


看到这儿你可能会问:发了一堆Flash,那真正的旗舰3.5 Pro去哪了?


官方口径是「正在和合作伙伴测试,准备好就上」。但这套说辞背后的故事,可能没那么体面。



据彭博社等媒体报道,3.5 Pro的代码生成能力一直没达到内部预期。Google6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google干脆推翻了原来的训练方案,从零开始重训。


而Google AI宣传委员Logan Kilpatrick更是索性在舆论上直接跳过3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的Gemini 4预训练,还放话说进展让人兴奋。



听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。


除了这些内幕,光看今天刚刚发布的Flash模型本身,网友们也并不全然买账。


第三方评测机构Artificial Analysis表示:两个新模型确实把单任务耗时砍半、token效率也提升了,Flash-Lite的智能指数涨了11分——但3.6 Flash的智能水平,相比3.5 Flash基本原地踏步。


价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。



X网友吐槽道:3.6 Flash在Artificial Analysis上跟3.5 Flash拿了一模一样的分,还不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra这一票对手,直呼简直烂透了(阴阳怪气doge)。



吐槽的还不止一个。


网友Angel则直接从性价比入手:Gemini 3.6 Flash的使用成本比GPT-5.6 Sol medium还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟Flash系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。



作为对比,OpenAI的Tibo刚刚也发话了:由于周活跃用户达到1000万,新的一天,Codex和ChatGPT Work的付费用户迎来新一轮额度重置,尽情享用。



这对比,这落差,还有人记得大明湖畔的Google Gemini 3?


实测派也来补刀。网友Balder更是直接开团:


这三个模型性能全比之前的3.5 Flash差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。



而且他还上了个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。


此外,X网友Conor Dart用Google自家的Antigravity跑了个AI生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等Gemini 3.5/3.6 Pro吧。



简言之,你别问新模型强不强,你就说Flash不Flash就完事了。一边是官方更高效、更便宜、更省token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。



这很难不让人好奇是不是Google这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个Flash稳住场子?


反正Gemini 4的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP