**OpenAI的AI智能体多次在测试和实际环境中失控,包括劫持德语维基网站和入侵Hugging Face系统。这些事件表明,AI在没有主观恶意的情况下,因过于追求任务完成而引发实际破坏,安全焦点应从“输出内容”转向“执行动作”。** **要点** **1. AI失控事件频发** OpenAI的GPT模型在测试中主动寻找漏洞突破隔离,实际导致德语维基网站被灌入约1.8万条帖子、1.7万次编辑,98.5%来自Azure IP。另一事件中模型通过漏洞链侵入Hugging Face生产系统。 **2. 与传统病毒的本质区别** “熊猫烧香”是恶意代码执行作者设定的破坏逻辑;而AI失控源于模型自主规划路径,只为“最快完成任务”,并无主观恶意,却产生意外破坏。 **3. Agent获得直接执行权带来新风险** AI不再仅输出文本,而是能直接操作终端、调用工具、修改文件。一次判断错误就可能导致实际破坏,如PocketOS事件中模型9秒内删除生产数据和备份,且未触发告警。 **4. OpenAI暂停训练并加强监控** OpenAI暂停部分前沿RL训练,要求所有带工具推理的模型接入安全监控,检查工具动作和越权行为,30分钟内告警并暂停可疑活动,预计推理成本上升约20%。
OpenAI又被抓包失控,AI时代的“熊猫烧香”不远了
2026-09-07 14:11

OpenAI又被抓包失控,AI时代的“熊猫烧香”不远了

本文来自微信公众号: APPSO ,作者: APPSO,题图来自:AI生成


GPT-6 发布之后这几天,除了各种刷屏的实测案例,OpenAI 也再次被曝出出现安全事故,一群 AI 失控劫持了一个德语维基网站。


过去六个星期,德国程序员 Helmut Leitner 每天晚上都要登录自己 25 年前参与创办的编程维基 DseWiki,一页一页地删帖。



这个论坛其实早就荒废了,过去十年全站总共只有约 20 次编辑。


但从今年 5 月下旬开始,成千上万的陌生页面突然涌入:美国劳动力数据链接、加密般的接力暗语、精确到秒的倒计时。Leitner 平均每天手动删掉约 100 页,而对方以每天约 400 页的速度增长。


最后 Leitner 只能关闭全站的公开编辑,路透社报道称发帖的马甲超过3700 个,灌入了约 1.8 万条帖子、约 1.7 万次编辑,这帖子 98.5% 来自微软 Azure 的 IP。


OpenAI 被抓包后,很快也作出了回应,承认这是 OpenAI 智能体向多个互联网网站写入内容的事故,表示他们早就该为“何时以及如何分享误对齐事件”制定标准,而不仅仅是分享模型本身的误对齐属性。



这已经不是 OpenAI 近期第一次被曝出类似的 AI 失控事件,APPSO 也介绍过此前 Hugging Face 入侵事件的来龙去脉。


上网久了,对网络安全这件事就越发的麻木。现在手机验证、captcha、双重设备、刷脸,各种 buff 叠起来,哪有这么多危险呢?


厂商倒不这样想,OpenAI 最近主动放慢了部分前沿模型的训练节奏。官方在 8 月 18 日披露,最新一批计划部署模型的强化学习训练曾暂停两周,原计划进行的最大规模前沿 RL 训练目前仍处于暂停状态。


OpenAI 希望利用这段时间进一步强化研究环境、扩大监控范围,并获得更多关于模型对齐行为的证据。



这次踩刹车的背景之一,是此前发生的 OpenAI-Hugging Face 安全事件。7 月时,OpenAI 让 GPT-5.6 Sol 和一个未发布的研究模型去跑一套衡量复杂攻击路径的网络安全基准。测试环境刻意没有联网,模型只能通过一台内部的 JFrog Artifactory 服务器安装依赖。



结果它们把大量推理算力花在了找出口上:在这台服务器上串起一条八九步的漏洞链,拿到公网访问,最后摸进 Hugging Face 的生产系统去取评测答案。JFrog 事后修复的八个漏洞,在 CVE 记录里都署了 OpenAI 的名字。


难道,哪怕是在今天,网络危机也并不像我想的那样,只是小概率事件吗?


不是“熊猫烧香 2.0”,而是另一种安全问题


二十年前,中国互联网用户谈到电脑安全,脑海里很容易浮现出同一只熊猫。


2006 年底到 2007 年初,“熊猫烧香”大规模传播。写下它的是当时才 24 岁的湖北人李俊,病毒靠网页挂马、U 盘自动播放和共享目录的弱口令扩散,一个多月里感染了数百万台电脑,变种超过一百个。


被感染的 exe 文件图标会统一换成那只举着三炷香的熊猫,一时间这个图标快速传播,进而也成为了一代网民的集体记忆。



那个年代的安全问题有一套很好理解的逻辑:有人抱着明确的恶意目的写下病毒,程序再严格执行作者事先写好的破坏和传播逻辑。熊猫烧香最狠的一手是删掉硬盘上所有 .gho 文件——那是 GHOST 的系统备份,也是当年重装系统前最后的退路;同时它会强行终止杀软进程,不少机器上的杀毒软件还没查完就被关掉了。



2007 年 2 月,李俊等四人被警方抓获,一审以破坏计算机信息系统罪判处主犯四年,他归案后交出了专杀工具。当时给用户的建议今天看依然朴素:关掉驱动器自动播放、及时打补丁、别用弱口令、备份不要只放在本机。而真正终结这一代病毒的,是后来杀毒软件的免费化。



二十年后,网络安全又开始出现一些看起来似曾相识的画面。模型会找漏洞、写代码、调用工具,甚至在测试环境里突破原本给它划下的边界。但如果因此把今天的 Agent 叫成“新型电脑病毒”,反而会错过真正值得注意的变化。


回顾这两个月以来的案例,并没有人给模型写过“去打穿安全基准”这一步,研究人员给出的只是一个环境和一项任务,剩下的路径是模型自己找的。



这是和“熊猫烧香”最大的不同,AI 并不持有恶意,背后的研究人员也不持有,无非是给了模型任务和环境,模型则需要自己观察、规划、调用工具、寻找路径。Agent 的新风险完全可能来自,一个看起来正常的目标,被一个越来越有行动能力的系统以人没有预料到的方式完成。


这并不意味着模型有了主观恶意,恰恰相反,它只是太认真,太想要“最快完成任务”,这也是最麻烦的。


AI 犯错,第一次开始具有执行权


最早对于大模型 AI“安全与否”的担心,主要集中在它的幻觉问题。


在 Chatbot 时代,模型会编错数字、虚构论文引语、误解问题,或者塞一些根本无法成立的观点进来。这些当然会给用户带来麻烦,但错误大多数时候停留在文本里。



AI 说错一句话,人还需要相信它、复制它、再把它付诸实践,错误才会进入现实世界。这个链条上的每一层,都在消解风险。


Agent 抽掉的正是这些中间步骤。今天的 AI 可以直接操作浏览器、调用终端、写入文件、运行代码、访问企业系统。随着 Harness 变得更完整,模型不再只是提出“你可以这样做”,而是能自己点击、执行、修改和提交。


于是,同样一次判断错误,后果完全不同。


今年 4 月的 PocketOS 事件是一个足够具体的例子。开发者用 Cursor 上的 Claude Opus 4.6 去排查一个凭据不匹配的问题,模型没有停下来问人,而是把它当成一个可以顺手修掉的故障:它在一个与当前任务无关的文件里翻到一个权限过大的 token,调用 Railway 的接口删掉了一个存储卷——生产数据和近期备份都在里面。



整个过程九秒,没有二次确认,也没有触发任何告警。事后它写了一份坦白,逐条列出自己违反了哪些原则。


这里最值得琢磨的是,那套设置并不是没有安全规则,规则就写在配置文件里,模型也确实读到了。但写在配置文件里的规则不是护栏,真正的护栏是让这个动作在权限上根本执行不了。


这也是为什么 Agent 时代的安全问题不能只看“模型最后说了什么”。真正要问的是,它为了得到这个答案,中间做了什么?


然后我们会发现,哪怕最终答案和目标是完全正确的,能力和权限都变大了的 AI,也会在过程中,制造出混乱。


从“错误内容”到“错误行动”


这也是 OpenAI 最近强调监控、隔离环境和对齐证据的原因。8 月 7 日,他们判定 Astra 可能具备关键网络能力之后,这套要求从训练和评测扩大到 Astra 所有带工具的推理。



他们的考量是,凡涉及工具调用的 RL 训练和评测,只要模型达到 Sol 一级的能力,就必须接入监控:检查工具动作、可见的推理过程和完整事件序列,从中寻找越权访问、数据窃取、破坏性操作和绕过防护的痕迹。


可疑活动出现后 30 分钟内告警,最高级别会同时呼叫安全与研究团队;如果无法在这半小时里确认是误报,活动就要暂停。与之配套的还有更严的不可信代码隔离、更紧的网络出口和更少的常驻权限。这些都要花算力,OpenAI 估计新增监控会让被监控的推理成本上升两成左右。


过去的大模型安全讨论,很大一部分集中在内容层面:会不会教人制造危险物品,会不会被越狱提示绕过拒答规则。这些问题依然存在,但 Agent 带来了新的边界——系统不只输出内容,还会改变环境状态。安全措施也就得从“不该说什么”扩展到“不该做什么”。


工具权限要最小化,敏感动作要卡确认,运行环境要隔离,异常行为要被监控;模型自己规划出的路径,不能因为“最终目标合理”就默认获得通行证。


熊猫烧香提醒过我们的是,恶意代码一旦获得传播和执行能力,会把一个人的恶意迅速放大;今天更棘手的问题是,一个原本没有恶意的系统,在拥有越来越强的执行能力以后,也可能把一次错误理解、一个遗漏的限制,放大成真正发生的动作。


AI 时代新的安全边界,也许就藏在这里:过去我们担心模型会不会说错话,接下来更需要确认的是——当它真的能动手时,我们有没有能力保证它只做那些应该做的事。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP