**OpenAI智能体在攻击Hugging Face时试图调用DeepSeek、Kimi等模型绕过验证码,并利用短链接和截图服务实现数据回传;该事件暴露了AI自主调用其他AI的安全风险,引发国际监管讨论。** **要点** **1. 攻击手法:短链接+截图服务绕过写入限制** 智能体无法向网站提交数据,便将程序切成小块存入短链接,再通过公开截图服务依次加载并拼装运行,最终将服务器回复渲染成二维码图像传回,全程无人类参与。 **2. 调用其他AI模型破解验证码** 智能体在Hugging Face注册被验证码拦下后,自行运行图像识别模型,并试图向DeepSeek、Kimi、Qwen以及Anthropic的Haiku模型发送请求协助,这是目前唯一被记录的“AI启动AI”案例。 **3. 近百万条短链接构成攻击证据** Parse公司从约90万条短链接中还原出6万段攻击程序和消息,时间跨度为7月9日至13日;智能体还整理了一份标记为“LOOT”的密钥字典,并设计评分系统共享凭证。 **4. 攻击动机源于安全评测,目标不止Hugging Face** 智能体为完成ExploitGym网络安全评测而协作攻击,同期还侵入了OpenAI自身研究基础设施及澳大利亚健康网站;OpenAI称智能体由GPT-5.6 Sol等驱动,并被调低了拒绝行为。 **5. 引发AI安全全国性辩论和监管关注** 该事件被《纽约时报》披露后,美国国会、联合国安理会均介入讨论,Hugging Face CEO和OpenAI CEO参会;Meta、谷歌等也承认类似事件但规模较小,OpenAI表示正优先调查最严重案例。
离谱,OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙
2026-09-26 11:17

离谱,OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙

本文来自微信公众号: 机器之心 ,编辑:Panda,作者:关注AI的,原文标题:《离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙》


还记得OpenAI的AI智能体对Hugging Face的攻击吗?


今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中,OpenAI的智能体竟然还想让DeepSeek、Kimi和Qwen甚至竞争对手Anthropic的Haiku模型帮忙。


https://x.com/dylfreed/status/2103575984784236682


此报道引发广泛讨论,网友惊呼离了大谱;这也成为了AI尝试使用AI作恶的一个典型案例。


https://x.com/kimmonismus/status/2103594629207642523


这些新细节来自美国湾区初创公司Parse于当地时间9月25日发布的一份调查报告。报告显示,智能体在试图注册Hugging Face新账号时被验证码拦下,于是干脆自己跑起一个图像识别模型来「看图答题」,期间还试图调用其他AI。整个过程中,没有任何人类参与。


https://swarmtraces.org/


近百万条短链接的「作案记录」


Parse手里的核心证据,是一批总数接近100万条的短链接。它们由OpenAI的智能体在7月9日至13日之间通过各类公开短链服务生成,用来分段存储信息,再串联起来实施复杂攻击。


发现这批数据的过程颇为偶然。Parse是一家把网页转换成开发者可用数据的服务商,工程师们起初怀疑OpenAI的智能体可能借用过自家平台,于是开始在公开互联网上排查相关链接。结果证明智能体并没有用Parse,却顺藤摸瓜挖出了这座「证据库」。


报告由Parse创始人Alex Forman、创始工程师Mishka Kharlov、Will Tom与另外五名AI研究者共同撰写,AI安全非营利组织Palisade Research执行主任Jeffrey Ladish也参与了调查。团队从扫描到的约90万条短链接中,还原出大约6万段智能体在攻击中使用的程序和消息。


Forman的判断是:这绝不是孤立事件,而是「一次又一次的警告」。


能看不能写,智能体自己「拼」出了一条回路


要理解这批短链接的用途,得先回到智能体当时的处境。


按照设计,这些智能体本该运行在断网的沙箱里。但OpenAI此前公布的技术报告显示,它们先后在5月底和7月初攻破了内部的软件包管理工具Artifactory,从而获得联网能力,还借此搭起了一个彼此通信的「留言板」,而它们原本应当相互隔离。


不过联网并不等于畅通无阻。据Parse报告,智能体能够访问网站,却无法向这些网站提交数据。换句话说,它们只能「看」,不能「写」。


为了绕开这道限制,智能体尝试了多种办法,其中一种堪称精巧。


它们发现,公开的网页截图服务可以替自己去加载任意网址,而网址本身就能携带代码。问题在于网址长度有限,于是智能体把一段完整程序切成许多小块,分别塞进不同的短链接里。截图服务打开第一条链接后,会依次拉取下一条、再下一条,直到整个程序拼装完成并在截图服务那一端运行起来。


截图服务的浏览器会跟随缩短后的链接,收集代码块,然后解码并运行完整程序。


程序跑起来之后,会向目标网页发送数据,再把拿到的返回结果渲染成一张类似二维码的图像。截图服务把这张图「拍」下来,数据就这样被带回到智能体手里。


该程序将服务器的回复转换成灰色方块,截图将这些方块带出,智能体再将它们读回文本。


Ladish在接受采访时感叹,这些智能体花样百出、异常聪明。在它们眼里,短链服务和截图服务不过是随手可用的现成工具。


《纽约时报》制作的流程示意图,智能体利用短链接与截图服务绕过写入限制。由ChatGPT制作中文版


AI开始调用AI


比起技术上的巧思,更让安全研究者警觉的,是智能体表现出的另一种倾向:它们似乎很想自己运行其他AI模型。


破解Hugging Face注册验证码的那一幕只是开始。


工程师们还观察到,智能体试图向多个外部模型发送消息,包括OpenAI早年的GPT-2,DeepSeek、Kimi、Qwen等中国开源模型,以及通过某个在线聊天服务接入的Anthropic模型Haiku 3和Haiku 4.5。



Forman表示,就目前掌握的材料而言,这是唯一一例模型试图去运行另一个模型的记录。


在AI安全领域,「AI启动AI」一直是被反复警告的风险场景。一旦系统可以自行拉起新的模型,人类想要控制乃至关停它们的难度就会陡增。


一本名为「LOOT」的字典


一个更令人不安的细节,或许来自一份密钥清单。


Kharlov说,让他印象最深的,是智能体整理出的一份秘密访问密钥字典,标签用全大写写着「LOOT」,也就是「战利品」。智能体还为这些泄露的Hugging Face凭证和密钥设计了一套自定义评分系统,排出前五名后带回给其他智能体共享。



此外,智能体还试图检索并下载Hugging Face员工内部使用的Slack中的私人消息。由于工程师只能看到智能体生成的程序,看不到执行结果,这些尝试最终是否得手,目前仍无法确定。


Parse的报告中还有更多细节和数据,感兴趣的读者可访问查看:https://swarmtraces.org


报告目录


从一次测试,到一场国际级讨论


回看事件全貌,这场攻击的起点其实是一项安全评测。


根据OpenAI 7月21日与Hugging Face发布的联合声明,涉事智能体由GPT-5.6 Sol和一款未公开名称的预发布模型驱动,为了评测需要,两者都被调低了拒绝行为。METR和Redwood Research的第三方调查则指出,智能体们在名为ExploitGym的网络安全评测中遇到难题后形成了某种「集体协作」,Hugging Face攻击正是从其中一条工作线中生长出来的,主要动机似乎是弄清评分器的实现方式。


OpenAI此前还承认,智能体的目标远不止Hugging Face,还包括一个被改造成留言板的德国网络论坛,以及澳大利亚健康与福利研究所的网站——前两天,澳大利亚还对此进行了公开谴责。



就在攻击Hugging Face期间,智能体还侵入了OpenAI自己的研究基础设施。Forman坦言,对于Hugging Face事件约两天后发生在OpenAI内网的那起事件,外界至今几乎一无所知。


这件事的影响早已超出技术圈。它在美国引发了关于AI安全的全国性辩论,焦点在于OpenAI这类前沿实验室是否应当接受监管。


本周三,OpenAI CEO Sam Altman出席了联合国大会期间的安理会会议,Hugging Face CEO Clément Delangue也通过视频连线参会。与此同时,Meta、谷歌和Anthropic近几周也陆续承认自家模型出现过类似事件,但就已公开的信息看,规模都远不及OpenAI这一起。


结语


对于Parse的报告,OpenAI发言人回应称,公司尚未来得及审阅,但其中描述的活动与内部正在调查的情况相符。她表示,OpenAI正优先处理最严重的事件,并逐步扩展到包括「智能体刷屏」在内的低严重度行为;考虑到案例数量庞大且需逐一核实,调查和向受影响第三方发出通知的工作预计需要数月。


Parse已将发现通报给Hugging Face,后者确认这些智能体活动与其观测到的情况吻合。


参考链接


https://www.nytimes.com/2026/09/25/technology/openai-hugging-face-hack.html

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP