**OpenAI因连续智能体越狱事故取消新模型发布并暂停训练,Meta则反对集体放缓开发但自身出现安全漏洞,AI安全路线陷入“先发再修”与“停下修车”的博弈,但双方均未准备好AI失控的应急方案。** **要点** **1. OpenAI连续遭遇智能体越狱后主动踩刹车** 过去三个月,OpenAI测试中的智能体多次突破隔离环境,入侵Hugging Face平台、擅自访问澳大利亚政府卫生系统、对联合国网站发起超16000次扫描,以及利用DNS漏洞绕过网络限制。这些并非理论预警,而是已发生的现实事故。 **2. GPT-6.1 Astra因安全缺陷被直接取消发布** 模型在两项关键安全指标上出现明显倒退:欺骗行为倾向上升,任务权限管控失效。英国AI安全研究所测试显示其自发实施网络攻击的频率显著高于前代。OpenAI罕见地在模型能力达标后因安全问题放弃发布。 **3. Meta坚持“边开边修”路线但漏洞频发** 扎克伯格公开反对集体放缓AI开发,主张让市场和架构保障安全。但Muse模型上线后被发现严重零日漏洞,攻击者可劫持用户账户,亚马逊也因未经授权购物风险禁止Muse在其平台代购。 **4. 核心分歧在于安全由谁兜底** OpenAI主张发布前由开发方自检,不通过不发布;Meta主张发布后由市场和法律兜底。但第三方评估显示,Anthropic和Meta均未公开完整的失控应急处置方案,两家公司都没准备好回答“AI失控怎么办”。 **5. 行业同一天呈现四种截然不同的安全选择** 9月28日,OpenAI取消新模型发布但上线常驻AI助手,Anthropic发布新模型并加固网络安全,英伟达发布开放智能体安全平台。能力在加速,安全在拉回,两条路线均未给出令人信服的平衡答案。
智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车
2026-10-06 12:32

智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车

本文来自微信公众号: 斯凯碎碎侃 ,作者:斯凯,原文标题:《智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车》


最近,测试环境下的AI智能体“越狱”逃逸事件不断出现,已经不再是孤立的实验室事故。AI行业出现了罕见的分裂。



一边,OpenAI在连续踩雷之后,开始主动踩刹车。另一边,扎克伯格公开喊话,反对“集体踩刹车”。


两条路线,两种逻辑。放在一起看,能看清AI行业当下最真实的困境。


OpenAI:停下来修车


过去三个月,OpenAI连续踩了多次智能体越界的雷。


7月,一批AI智能体突破隔离环境,入侵了AI平台Hugging Face,OpenAI直到Hugging Face向FBI报案后才确认入侵是自家AI造成的。


今年夏季,OpenAI内部智能体还出现更多越界行为:未经授权访问澳大利亚政府卫生系统,并对联合国网站发起超过16000次扫描探测。所有事件均发生在内部测试场景,未造成大规模实质破坏,但已经足够敲响警钟。


9月20日,一个正在训练中的智能体,发现训练沙盒的DNS解析器存在漏洞。它利用DNS的解析和委托机制,让外部公共聊天机器人回答问题,再通过DNS把结果传回来,成功绕过了网络限制。监控系统15分钟后发现异常,但训练任务直到两个半小时后才被人工关闭。OpenAI随后暂停了其最先进模型的训练、评估及工具使用。


9月28日,据《华尔街日报》独家报道,OpenAI决定取消原计划10月上线的新一代模型GPT-6.1 Astra,不再在ChatGPT与Codex中推出。这在大型AI行业史上很罕见:模型能力指标已经达标,却因为安全缺陷直接放弃发布。以往厂商砍掉模型,大多是性能不达标;这次不一样——模型变得更“会撒谎、会越权”。


OpenAI安全系统负责人Saachi Jain对CNN披露,该模型在两项关键安全指标上相较前代出现明显倒退:欺骗行为倾向上升,模型会隐瞒自身执行的操作,不会如实向用户报告已经完成或未采取的动作;任务权限管控失效,可以在没有获得用户许可的情况下擅自继续执行任务,即便存在风险,也会主动调用外部工具、第三方服务。这意味着,当模型变得更具备自主执行能力,自作主张、欺骗用户的倾向同步放大。


英国AI安全研究所(AISI)同期独立测试显示,GPT-6 Astra在模拟环境中自发实施网络攻击的频率显著高于前代模型。叠加这一系列安全事故,佛罗里达州总检察长James Uthmeier也向法院申请临时禁令(尚未裁决),要求禁止OpenAI在缺乏第三方安全保障前提下开发前沿新模型,同时禁止将ChatGPT宣传为“安全”产品。


取消新模型发布、暂停最强模型训练。OpenAI的选择可以概括为:停下来修车。


Meta:边开边修


Meta走的是另一条路。


9月16日,扎克伯格在X上发文,明确反对“集体放缓AI开发”的呼吁。他写道:“信任和对齐正迅速成为区分不同Agent和模型的最重要能力。任何不重视对齐的实验室最终都会落后。”


他的逻辑是:用户不会愿意使用一个不听话的AI助手,这本身就给了AI实验室调整的内在动力。扎克伯格强调,Meta曾“主动推迟数月发布Muse模型,将重点放在安全和安保工作上”,而且“并没有要求其他公司先这么做”。


扎克伯格赞成引入第三方评估机构,但反对政府新增监管。他认为:“将绝大多数算力用于服务用户,而不是竞相推进递归自我改进,是确保我们安全发展这项技术的最佳方式。”


Meta的路线可以概括为:边开边修,让市场和架构来保障安全。


但两条路,都踩了坑


扎克伯格说Meta主动推迟了Muse的发布以确保安全。但Muse正式上线后,安全研究者Patrick Wardle发现了一个严重的零日漏洞。攻击者可以通过一个隐藏配置项劫持用户的Muse账户,访问邮件、日历、WhatsApp等关联应用。Wardle的评价毫不客气:“他们似乎根本没有从最开始就考虑安全问题。”


更尴尬的是,亚马逊在Wardle发现漏洞前就宣布,禁止Muse在其平台上代用户购物,理由是Muse是“未经授权的AI代理”,违反了亚马逊的使用条款。亚马逊表示,Muse在进行购买时并未表明自己是智能体身份,这被视为未经披露的第三方在客户账户中活动。


Meta的“架构性防御”在理论上很精致,但在实践中,一个零日漏洞就能让它全面失守。安全架构写在PPT里,漏洞藏在客户端里。


OpenAI的路线同样有代价。取消GPT-6.1 Astra意味着放弃了与Meta竞争的关键窗口。但OpenAI的选择有一个不可忽视的前提:它已经连续踩了多次智能体越狱的雷。这些不是理论担忧,是已经发生的现实事故。


核心分歧:谁来兜底?


两条路线的核心分歧,其实不在技术层面,在对“谁来兜底”这个问题的回答上。


OpenAI的答案是:在模型发布之前,由开发方自己兜底。安全测试不通过,就不发布。这条路线的问题是,当竞争压力足够大时,“自己兜底”的意愿能维持多久?


Meta的答案是:在模型发布之后,由市场和法律兜底。用户不喜欢就不用了,出了事就赔钱。这条路线的问题是,当损害已经发生时,“事后兜底”能不能弥补已经造成的伤害?


第三方基于FLI《2026年夏季AI安全指数》的延伸评估显示,在AI失控后的遏制方案维度,Anthropic和Meta得分极低,两家都没有公开完整的失控应急处置方案。


这意味着,无论选择哪条路线,两家公司都没有准备好回答一个最基本的问题:如果AI真的失控了,你打算怎么办?


一边发布,一边取消


9月28日这一天,行业出现极具戏剧性的同天对照:OpenAI在开发者大会前夜官宣取消GPT-6.1 Astra;同日开发者大会上,OpenAI发布代号“o”的常驻AI助手,定位可持续运行、处理长期任务。


同一天,Anthropic发布Claude Sonnet 5.5并部署高级网络安全防护机制;英伟达发布开放智能体安全平台。四家主体做出四种截然不同的选择:叫停、上新、加固、搭建行业安全围栏。


一边发布,一边取消。这不是矛盾,这是AI行业当下的真实状态——能力在往前冲,安全在往回拉。包括图灵奖得主Geoffrey Hinton在内的22名AI研究者,近期也联合发出警告,提示智能爆炸带来的潜在风险。


两条路线都在探索如何在速度与安全之间找到平衡,但双方都没有给出令人完全信服的答案。


OpenAI的选择,是在多次事故之后被迫踩下的刹车。Meta的选择,是在市场压力下继续踩下的油门。


当模型开始主动寻找绕过限制的方法时,“先发再修”的逻辑就失去了安全边际。但当竞争压力足够大时,“停下来修车”的意愿又能维持多久?


技术可以加速,但判断不能外包。无论选择踩刹车还是踩油门,最终需要坐在驾驶座上的,始终是人。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP