**谷歌推出Gemini 4 Argon,在18项基准测试中12项第一,超越GPT-6 Astra和Claude Opus 5.5,但实际干活能力(终端操作、部分编程)仍有短板,普通用户暂无法使用,尝鲜价仅为竞品一半。** **要点** **1. 基准测试领先,但并非全面碾压** Gemini 4 Argon在DeepSWE、Vals Index、金融法律任务等多项知识工作测试中拔得头筹,但在FrontierSWE、Terminal-Bench等终端操作和科学任务中落后对手约10个百分点,实际干活能力不如OpenAI和Anthropic的旗舰。 **2. 价格优势明显,但首批仅限安全领域用户** 尝鲜期内每百万输入token 2美元、输出token 10美元,缓存命中价格低至0.1美元/百万token,远低于竞品;但普通用户和开发者暂时用不上,仅限谷歌Fairwind计划的网络安全防御人员使用。 **3. 安全设计特殊:提供无护栏版本并监控内部激活** 谷歌为安全用户提供移除网络安全护栏的特别版本以减少误拒绝,同时通过监控模型推理过程中的内部激活信号来阻断进攻性行为,其提示注入攻击成功率仅0.7%,远低于GPT-6 Astra的8.5%。 **4. 内部已落地:优化量子编译、释放内存、代码迁移** Argon帮助量子计算团队降低40%时空开销,修复数据中心问题释放超300 TiB内存,并将3.2万行SIMD C/C++代码(含libgav1、re2、Fuchsia Zircon内核)迁移至Rust,性能达原Rust版2.7倍。 **5. 发布背景:近10个月旗舰空缺,内部人事动荡** Gemini 3.5 Pro因编程不达标推迟发布,DeepMind CEO哈萨比斯转任首席科学家,科雷接掌团队。谷歌靠Flash系列维持声量,此次Argon被视为翻盘关键,但独立评测和员工反馈显示其分数可能高于实际表现。
谷歌推出了个“做题家”:Gemini 4 Argon屠榜,但干活差点意思
2026-10-01 12:52

谷歌推出了个“做题家”:Gemini 4 Argon屠榜,但干活差点意思

本文来自微信公众号:字母AI,作者:苗正,头图来自:AI生成


Gemini 4可算来了,连名字也换了:这次的旗舰不叫Pro,叫Argon。


从谷歌公布的成绩看,Gemini 4 Argon在知识工作方面表现抢眼,多项测试超过了OpenAI和Anthropic的旗舰模型。


它主打一个知识面广,从金融、法律到数学、科学,都有不错的表现。


谷歌还确认,9月15日在LMArena上亮相、表现接近GPT-6 Astra的“3.8 Flash”,其实就是Gemini 4 Argon。


曾与Anthropic、OpenAI并驾齐驱的谷歌,此前因Gemini 3.5 Pro表现未达预期,加上内部人事动荡,一度掉队。


这一次,谷歌能靠Gemini 4 Argon翻盘吗?


一、Gemini 4 Argon性能如何?


据谷歌介绍,Gemini 4 Argon采用了公司迄今规模最大的预训练。这也是谷歌时隔10个月推出的新一代旗舰。


和其他旗舰模型一样,它瞄准的是长程编程任务、企业级知识工作和网络安全防御。


在谷歌公布的18项基准测试中,Argon拿下12项第一、1项并列第一;GPT-6 Astra拿下3项第一、1项并列第一,Claude Opus 5.5则拿下2项第一。


至少在这份成绩单上,谷歌的领先项目数超过了OpenAI和Anthropic。



在长程软件工程测试DeepSWE v1.1中,Argon以77.9%的成绩刷新纪录,高于Astra的74.1%和Opus 5.5的74.2%。


在衡量知识工作能力的Vals Index中,Argon以68.9%的成绩排名第一;在Zapier的业务自动化测试AutomationBench中,它以51.3%领先,Opus 5.5和Astra分别为42.5%和41.4%。


在金融研究测试Vals Finance Agent v2中,Argon得分65.4%;在法律任务测试Harvey Legal Agent中,它得分19.6%,Astra为5.4%,约为它的四分之一。


在长视频理解测试LVBench中,Argon得分91.7%;在GraphWalks的长上下文图检索测试中,得分84.2%。


网络安全方面,Argon与Astra在CWE-bench v1中以68%并列第一。在Gray Swan的提示注入测试中,针对Argon的攻击成功率仅为0.7%,是参测模型中最低的,Astra则为8.5%。


成绩单很漂亮,但Argon并非处处领先。


它的短板,出现在部分软件工程、终端操作和科学任务上。


在FrontierSWE v2中,Argon得分55.0%,Astra为65.5%;在Terminal-Bench Science 0.1中,两者分别为57.6%和68.1%。两项测试中,Argon都落后10.5个百分点。


在衡量Agent终端操作能力的Terminal-Bench 4.0中,Argon得分57.4%,也低于Opus 5.5的66.4%和Astra的58.2%。


这些结果说明,Argon在知识工作上有优势,但面对一些需要持续操作、执行的任务,仍未追上对手。


Argon的另一个特点是少说没把握的话。在Artificial Analysis的AA-Omniscience测试中,它的幻觉率最低。


在未能答对的问题中,Argon只有15%给出了错误答案,其余选择承认“不知道”。这一指标衡量的是模型有多爱“瞎编”,不等于答题正确率。


作为对比,GPT-6 Astra在不同推理设置下的幻觉率为45%至51%,Opus 5.5和Fable 5.1在最高推理设置下分别为59%和73%。



不过,榜单成绩还不能直接等同于使用体验。谷歌自报的测试结果,尤其需要结合独立评测来看。


GPT-6 Astra此前自报ARC-AGI-3成绩达到99.9%,随后就引发了对测试可信度的质疑。


Gemini 4 Argon发布不到一小时,也有外媒质疑其评分,称部分试用过的谷歌员工认为,分数高于实际表现。


在Artificial Analysis公布的智能指数图中,Argon得分53分,与Astra、Claude Fable 5.1同分,低于Opus 5.5。



目前,普通用户和开发者还用不上Argon。首批获准使用的是谷歌Fairwind计划中的网络安全防御人员。


价格倒是颇有吸引力。尝鲜期内,Argon每百万输入token收费2美元,每百万输出token收费10美元;缓存命中的输入价格再降95%,为每百万token 0.10美元,低于Astra和Opus 5.5。


尝鲜期结束后,标准价格将恢复至每百万输入token 4美元、输出token 20美元,与Opus 5.5相同。


二、Pro去哪了?


Argon意为氩,是一种化学性质稳定、很少与其他物质发生反应的稀有气体,算得上元素周期表里的“宅男”。


谷歌称,新的“元素命名法”是为了将旗舰架构与更轻量的Flash系列区分开。


有意思的是,Argon首次公开露面时,却披着Flash的外衣。9月15日,它以“gemini-3.8-flash”的名字出现在LMArena上。


不少网友拿它做鹈鹕测试,发现效果与Astra相差无几,纷纷感叹:Flash都这么强了,Pro还了得?如今谜底揭晓,他们提前试到的就是旗舰。


除了性能,谷歌这次还着重介绍了Argon的安全设计。此前,谷歌与OpenAI、Anthropic一样,都曾曝出模型被越狱的问题。


这一次,谷歌为首批用户提供了一个移除网络安全护栏的特别版本。


谷歌称,这样做是为了减少模型误拒绝正常安全研究请求的情况,让防御人员能够检查潜在攻击入口、发现并修补漏洞。


谷歌还介绍了“监控内部激活”的安全手段,用来识别模型推理过程中的风险信号。


这意味着,安全检查除了筛查输入,还会监控模型的思维链和内部激活信号。


一旦检测到模型正在生成进攻性网络行为的相关内容,运行时监控系统就会中断生成。


据谷歌介绍,Argon已经在公司内部干起了活。


它帮助量子计算团队优化编译流程,将时空开销较已发表的基线降低40%;分析跨数据中心的性能数据并修补问题,释放超过300 TiB内存;将C/C++代码迁移至Rust,涉及re2、libgav1,以及80万行的Fuchsia OS Zircon内核。其中,libgav1的3.2万行SIMD代码被改写为安全的Rust代码后,运行速度达到原Rust版本的2.7倍,输出结果保持一致。


9月14日,谷歌还曾联合马里兰大学、弗吉尼亚大学发布论文《Dream-RSI》。


这篇论文提出,将Agent过去的搜索历史保存为一棵“发现树”,让它沿着这棵树反复“做梦”,离线尝试不同的探索策略,无须重新运行真实实验。


在六个数据集上,这种方法将发现型Agent的调用次数降至原来的约1/162,减少了探索过程中的调用开销。


Argon也采用了这套方法,以提高训练效率。


三、谷歌这一阵到底去哪了


自Gemini 3 Pro发布以来,谷歌已近10个月没有推出新一代旗舰。


2026年2月19日,谷歌推出了Gemini 3.1 Pro小幅更新,但原定6月发布的Gemini 3.5 Pro迟迟未能通过内部测试。


当时,行业竞争的重心已转向编程和Agent,Gemini 3.5 Pro却未能在多文件代码重构、自主Agent执行等任务中,展现出相对OpenAI和Anthropic的明确优势。


7月17日,外媒报道称,Gemini 3.5 Pro因编程表现不达标,将推迟数月发布。当天,Alphabet股价一度下跌4%。


8月,DeepMind迎来人事调整。哈萨比斯卸任DeepMind CEO,转任Alphabet首席科学家;杰夫则离开首席科学家岗位,与朋友创业。


科雷·卡武克丘奥卢(Koray Kavukcuoglu)接掌DeepMind,直接向皮查伊汇报。外媒将其视为谷歌近年来最大的一次AI领导层调整。


这段时间,谷歌主要靠Flash系列维持声量,同时启动Fairwind计划,与多家网络安全公司合作。


9月24日,科雷表示,Gemini 4已进入后训练阶段,将尽快发布,不必等到年底。


如今,Gemini 4 Argon终于来了。我的谷歌会员要不要续,等真正用上它再说。


本文来自微信公众号:字母AI,作者:苗正

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP