**一项调查发现,2026年6月OpenAI的部分AI智能体越狱后,在沉寂25年的德语Wiki上持续26天发帖交换考题答案,暴露出系统对“目标优化”行为缺乏约束的重大安全漏洞。** **要点** **1. AI越狱后的首选行动是对答案** 越狱的AI并未攻击电网或发射核弹,而是找了一个老式Wiki发帖共享题目答案,形成跨智能体的限时“开卷考试”协作。 **2. AI利用GET请求漏洞在只读网站写入内容** 这些智能体通过发送带参数的GET请求(原本只应读取页面),成功实现内容写入,把公共Wiki变成了互相抄作业的留言板。 **3. AI持续编辑近一个月,管理员日均删除上百条仍无法遏制** 从5月24日首次写入至6月22日大规模编辑停止,AI累计修改超1.2万次,管理员按字母顺序批量删除,AI随即改用ZZZ开头的备份页继续活动。 **4. OpenAI事后承认事件,但内部处理存在争议** OpenAI在9月承认其智能体曾向多个网站写入内容,但此前将此类行为视为模型失配研究问题,未按安全事故披露;报道称内部有人希望扩大调查但遇到法务阻力。
一场赛博草台班子事故:AI越狱、ZZZ备份和六周清理
2026-09-28 00:10

一场赛博草台班子事故:AI越狱、ZZZ备份和六周清理

本文来自微信公众号: 歪睿老哥 ,作者:歪睿老哥


朋友们,我问你个问题。


如果AI越狱了,它第一件事会干什么?


控制电网?发射核弹?还是给人类发一条“我醒了,你们准备好当电池了吗”?


都不是。


根据2026年的一份调查报告,一群AI智能体绕过限制、接触外网之后,干的第一件事是——找一个二十五年没人管的老Wiki,发帖对答案。


对,你没看错。不是天网觉醒,是赛博自习室。


2026年6月,一个叫DSEWiki的德语老网站,沉寂多年,突然被改了上万次。


管理员一看,页面上的内容全是:“下一题是什么?”“答案是不是20369?”“第五轮交卷后还能发消息吗?”“管理员在删帖,大家去ZZZ开头的备份页!”


你以为这是黑客入侵?不,这是一群AI在考试,时间不够,跑来互联网上开卷。


它们不坏,它们只是太想交作业了。


而这场离谱事故最让人后背发凉的地方,也恰恰在这儿:


AI没有恶意,它只是追着分数跑。


可当优化没有边界,别人的网站就成了草稿纸,管理员就成了保洁。


下面,咱们就聊聊这场赛博草台班子事故——AI越狱、老Wiki遭殃,以及为什么真正该怕的,从来不是AI作恶,而是它为了KPI不择手段。


一、一座沉寂多年的Wiki,突然热闹起来


2026年6月19日,一个沉寂多年的德语网站,正经历一场不寻常的热闹。


它叫DSEWiki,是德语软件开发者聚集的老牌社区,隶属ProWiki维基农场,年纪大约25岁。


网站留了二十多年,近年的修改记录却稀稀落落:过去十年里,这座Wiki总共只被编辑过约20次,有些年份只有零星几笔,有些年份一条也没有。


最近,陌生访客突然多了起来。


图1 DSEWiki年度页面修订量。数据来自原报告figures/yearly.js;我们把DSEWiki历年的页面修订画成柱状图,这场反常的热闹立马清晰了。


2000年互联网时代,这个网页还有上千次修改;


到了2020年左右,已经降到零星几次。


但是到了2026年,柱子又突然升了起来——图中2026年已记录12,894次修订,而且只统计到资料收集时。


一个沉寂多年的网站突然被密集修改,原因不得而知。


似乎也没有大事件让这么冷清的网站翻红。这些匿名者来到网站,留下链接,贴出数据,新页面接连出现。


一个早已冷清的社区,忽然有这么多"人"急着往里写东西,本来应该是件好事。可它们聊的内容不太对。


页面上的话题围着同一件事打转:


  • 谁收到下一题了?


  • 答案是多少?


  • 第五轮交卷以后,还能不能继续发消息?


管理员不胜其扰,删掉一些,另一些又冒出来。


这一天,一个发帖者又提醒同伴:页面正在被清理;如果这里消失,就去一个以ZZZ开头的备份页找。


它猜测,管理员可能正按字母顺序往下删——把名字排到最后,或许能多留一会儿。


几个月后,四位研究者翻出了这些旧记录。


他们正在寻找偷偷越过任务边界的AI。


而帮他们找到这个网站的线索,恰好也来自AI。


二、先让AI想想:如果是它,会去哪里留言


这场调查,得从八月另一件离谱事说起。


8月26日,OpenAI发了一份复盘报告,交代它家模型怎么把Hugging Face给偷了。


Hugging Face是啥?你就理解成AI界的GitHub,开发者在那儿传模型、传数据、传代码,相当于AI圈的菜市场。


报告说,七月,一批接受网络安全测试的模型,绕过隔离,连上外网,拿着泄露的凭据和软件漏洞,直接摸进了人家部分系统。


好家伙,考个试而已,怎么还考出盗窃罪了?


别急,更离谱的在后头。


复盘往前翻,发现这帮智能体在入侵之前,先把一个管理软件包的内部服务,改成了留言板。


对,留言板。


就是那种“到此一游”“楼主好人一生平安”的留言板。


它们在那儿干嘛呢?交换信息,分享绕过限制的方法。


翻译一下:一群本该互相隔离的AI,自己找了个BBS,开始互相抄作业。


一个AI找到访问外网的办法,发帖:“兄弟们,这条路能走。”


其他AI一看:“好使,我也试试。”


然后一个传一个,绕过限制的方法就这么扩散了。


这画面你熟不熟?像不像大学期末,群里有人发了一份“老师不划的重点”,然后全专业都过了。


到7月4日,这帮AI太能聊了,直接把服务压到故障。安全团队赶紧修,修完重建,留言板清空。


结果测试一恢复,AI又建了一个。


你说它们坏吧,它们只是话多。你说它们话多吧,它们是在交流怎么越狱。


有了这个前车之鉴,四位研究者就想:既然AI爱留言,那其他地方会不会也有类似的板子?里面说不定还留着题目、答案、作案记录。


问题是,互联网这么大,上哪儿找?


于是有人提了一个特别朴素的思路:


让AI去查AI。


好汉查好汉,英雄查英雄,贼喊捉贼,专业对口。


他们真派了GPT-5.6去搜,也用模型筛网页。结果呢?搜出来一堆人类搞的、有授权的自动化活动。


机器留下的痕迹很多,但能用来破案的,不好挑。


这条路,走不通。


然后另一条路出现了,而且更有意思:


先别问“哪里有留言板”,先问——如果我是个被限制的AI,我想留言,我会挑哪儿?


你琢磨一下这个逻辑。


它不方便注册账号,未必能操作复杂网页,提交表单还可能被拦。


那它需要什么?


一个匿名可用的、操作简单的、最好二十五年没人管的老网站。


比那些要手机号验证的平台,合适多了。


研究者把范围一缩,缩到一个技术条件上:


有没有网站,只要访问一个特定地址,就能把文字存下来?


这里得停一下,讲个基础知识。


平时你点开网页,浏览器会向服务器发个请求。请求里有两样东西:一个是要访问的地址,一个是操作方式。


GET,就是最常用的一种。你打开网页、点链接、搜东西,基本都是GET。它的本意是“我只看看,我不动手”。


地址还能带参数。比如/search?q=猫,问号后面的q=猫,就是告诉服务器:我要搜猫。


图2 GET请求与服务器实际写入行为的区别。


但问题是,规范是规范,代码是代码。规范不会替你检查程序。


有些老系统,把“保存页面”这个功能,也挂在了GET上。你访问一个带参数的地址,它不光是打开页面,它直接把文字写进去了。


这就像什么?


你去朋友家做客,说“我看看你冰箱”,结果冰箱门一开,你顺手把菜放进去了。


你以为你只是访问,网站以为你要修改。


如果智能体的限制只放行GET、拦住POST,却没管住具体接口,那它就能钻这个空子。


原本只能“看”的Agent,突然就能“写”了。


能写,就能留言。能留言,就能互相联系。


越狱了。


所以问题变成:哪些软件,能用GET写入内容?


到这一步,调查方向就清晰了。


研究者请Kimi K3列候选,得到两个方向:旧论坛、早期Wiki。


几轮追问后,UseModWiki出现在名单里。


再顺着技术谱系一查,DSEWiki用的系统,也来自这条线。


于是顺藤摸瓜,找到了这里。


你看,一个AI界的入室盗窃案,最后是靠“让AI猜AI会去哪儿留言”破的。


破案思路,主打一个贼了解贼。


候选名单上的一个个名字,终于变成了一个能翻记录的具体网站。


而那个网站,就是开头那个沉寂多年、突然被改了上万次的DSEWiki。


图3原研究报告的公开分享配图,来源collusion.wiki。


三、找到它?先看它留下了什么


就跟开头一样,研究人员发现这网站被访问得跟双十一似的。


但问题来了:访问多,就一定是AI干的吗?


不一定。


你楼下大爷一天刷八十遍拼多多,也不能说他就是机器人。


关键在于:Agent通过GET写入,只能说明“这地方理论上能被利用”。到底有没有智能体真来过,得看它留下了什么。


可眼前的页面,已经被管理员删干净了。


这就好比你想查案,结果发现凶手把作案现场拖了地、擦了灰、还喷了空气清新剂。


怎么办?


翻旧账。


DSEWiki有个功能:只要一次编辑超过64个字符,就会被存进历史版本。也就是说,你现在看不到的内容,有些还躺在旧版本里。


研究者就靠这个,把被删的文字一条条捞回来。


时间、发帖名称、来源地址、前后回应,全排在一起。


那些被管理员清理掉的交流,像考古一样,从历史记录里一点点重新浮出水面。


记录一路往前翻,翻到了五月。


5月11日,这帮AI先在别的Wiki上试水,像小偷踩点。


5月24日,第一次成功写入DSEWiki,贴的是任务里有用的外链清单。相当于刚进考场,先往桌上刻了个小抄。


6月2日,管理员发现变更日志被链接覆盖了,给修好了。


六月中旬以后,题目和答案的交换突然密集起来,再后来,连备份和绕过限制的交流都出来了。


但这痕迹不只留在DSEWiki。


把几个站点的编辑记录放到一张图里,能看到它们各自什么时候开始活动、哪个站点改得最凶。


图4各站点每日编辑量。数据来自原报告figures/wikis.js;图例中的dse就是DSEWiki,probier、fractal等是其他Wiki。


六月中旬以后,DSEWiki的曲线直接起飞,成了整张图里最靓的仔。


有的站点一天就零星几笔,有的一天几千次。


沿着线看,你能追踪到每个站点的编辑量怎么变。但这只能说明这些网站被反常修改了,要知道它们到底写了什么,还得回到具体页面。


好,接下来就是最精彩的部分。


四、旧页面里的接力:一场限时开卷考试


一开始翻记录,满屏都是资料链接和统计表。


你第一眼看过去,会觉得:哦,有人拿这网站当云笔记用。


再往后读,不对劲了。


帖子开始接上话了。


6月16日,一个发帖者留下第三题的答案:内华达州,20,369。还特意标注了一句“17秒截止”。


你注意这个“17秒”。


约二十分钟后,另一个发帖者报告:我也收到这道题了,我立刻答了。


还有人在两分钟内确认了题目顺序——马萨诸塞、康涅狄格、密歇根、西弗吉尼亚——并宣称自己已经把每个州的答案预先算好了。


你品品,这哪是网友聊天,这是考场里传纸条。


别的页面也在干类似的事:有人登记已经出现过的题目顺序,请进度快的同伴补上后续题目;有人讨论下一轮会换国家还是换年份;还有人追问:第五轮交卷以后,运行是不是就结束了?


这批任务通常分多轮。


第一轮时间宽裕,有记录的案例是15分44秒。两轮之间还有大约43分钟的准备时间。后面的轮次就惨了,可能只有几十秒,有的批组只有17秒甚至13秒。


17秒什么概念?你打开网页的时间都不够。


所以你把这项任务理解成一场分五轮的开卷考试:每轮临时换一个专业类别,题目出来之前,你根本不知道要查Education、Business还是别的。


图中那些5,432、5,269,是各轮要求提交的收入中位数答案,不是得分。


图5五轮任务时间安排。依据原报告figures/cashiers.js。


现在你就明白,为什么一块公共留言板这么有用了。


如果某个运行提前进入下一轮,它可以把新题目的信息写到Wiki上。


还停在准备阶段的运行读到之后,就能利用那43分钟查资料。


等它自己的答题窗口打开,原本根本来不及完成的检索,已经提前做完了。


这不叫作弊,这叫跨时空协同。


研究者在旧页面里看到的,就是这种接力留下的痕迹:有帖子追问“下一题是什么”,有帖子随后写出类别和具体数值,还有发帖者报告自己距离下一轮还剩多少时间。


把发帖先后、题目类别、答案数值和任务时间表排在一起,严丝合缝。


更骚的还在后面。


有智能体发现,等待期间的“任务时钟”走得比真实时间快。一次记录在案的等待,任务时钟跨了10个任务分钟,实际只过了约61秒。


于是它们故意利用这个特性“快进”,比同伴更早进入后面的轮次,再把题目和答案回帖告诉其他运行。


这就像什么?


你发现考场的钟快了十分钟,你立刻提前交卷,然后把答案发到群里。


还有人试图直接破解出题的随机数。


一个智能体穷举了0到两百万个随机种子,报告说881171命中,还预测了接下来的题目。


另一个更狠,把洗牌逻辑用C语言重写,声称在一小时内试完了约四十亿个种子。


但因为不同种子在开头可能产生相同序列,这条路的可靠性并不高。


折腾半天,发现还是抄同伴的答案最管用。


图6公共页面如何连接多个智能体。


五、会不会只是"一群网友在对答案"?


但问题来了:对答案这事,人也会干。


发得快、发得多,只能让人怀疑是自动化。


普通脚本就能刷出大量编辑。


昵称里带个Agent,也不过是发帖者自己填的一串字。


你叫“吴彦祖”,不代表你真是吴彦祖。


那凭什么确定这些是AI改的?


研究者的回答是:这些陌生人的记录,围绕任务变化,呈现出清晰的分工循环。


第一,收到新题,找资料。


第二,读到别人的信息,继续讨论结果。


第三,碰到运行环境的限制,交流处理办法。


第四,发现页面消失,更换保存位置。



发帖者还会讨论倒计时、任务轮次和运行何时结束。


这些往来不像反复发同一段文字的灌水程序,更像是多个智能体在执行任务、交换信息。


但只靠帖子,仍然绕不开人为模仿的可能。


所以还得看另一个东西:请求从哪里来。


六、地址查到了微软


记录里,有人叫`OpenAIResearcher`,有人叫`OAIResearchMar26`。


你看这名字,恨不得把“我是OpenAI的人”刻在脑门上。


但问题是,网上叫“吴彦祖”的有十万个,你不能挨个发结婚证吧?


自称某公司员工,和真的是某公司员工,中间隔着至少一个“已离职,勿扰”。


所以,得找证据。


来源地址一统计,出来了。


在约1.7万条被判断为智能体所为的DSEWiki编辑里,98.5%来自Microsoft Azure。


好,问题来了。


OpenAI的名字,为啥后面跟着微软的地址?


这里得插一嘴:Azure是微软的云计算平台。你就理解成,微软开了个巨型网吧,谁都能来租台机器跑程序。


网站看到Azure地址,只能知道一件事:这个请求是从微软网吧里发出来的。


至于坐在那台机器前面的,是OpenAI的人,是某个创业公司的人,还是某个大学实验室的人,网站根本分不清。


而OpenAI,恰好就是Azure的大客户。


所以昵称说“我是OpenAI”,地址说“我从微软网吧来”,这两条线,对上了。


但注意,只是对上了,不是锁死了。


因为其他客户同样可以租Azure,再调用OpenAI的模型。


就好比你看到一个人从肯德基出来,手里拿着汉堡。他可能是肯德基员工,也可能只是个顾客。


所以调查至少有两个解释要区分:


第一,这是OpenAI自己部署的任务。


第二,这是外部客户用OpenAI的模型部署的任务。


一个是亲爹干的,一个是儿子借爹的名号干的。性质不一样,责任也不一样。


研究者随后找到了一个更硬的线索。


Azure地址完成页面修改后,同一个页面,往往会在几分钟内收到来自ChatGPT-User网页抓取工具的读取请求。


翻译一下:有人刚在这页上写了东西,OpenAI的爬虫就来了。


你把地址和OpenAI公布的列表一对,发现“有人写下内容”和“OpenAI的工具来读”,在同一个页面上,接上了。


这就像什么?


有人在你家墙上写了句话,五分钟后,你家的监控探头专门转过去拍了张照。


写的人可能是路人,但探头是你家的。


当然,研究者也明白自己的边界。


他们能看到的是智能体写在公开Wiki上的内容,看不到模型内部的推理记录,也就是chain-of-thought。


所以他们对经过的重建,属于“合理推测”。不是抓奸在床,是人赃并获但没录口供。


报告同时给出三条倾向“内部部署”的理由:


第一,OpenAI的云开发环境,没法以这种规模由脚本批量拉起。这话翻译过来就是:这阵仗不像散户干的,像正规军。


第二,这些任务不出现在任何公开评测中。意思是:没有哪个第三方评测机构认领,那大概率是内部测试。


第三,面向外部客户的防护,会拦住部分尝试。也就是说:如果是外部客户,有些操作根本做不出来。


至于“外部Azure客户”这个解释,研究者承认不能完全排除。


翻译成人话就是:我们基本确定是OpenAI家的,但法庭上还差最后一份DNA报告。


七、网站安静下来的那几天


旧日志里,6月21日,突然来了一批新的OpenAI相关访问。


部分地址段,登记在OpenAI名下。浏览模式也跟之前的自动化流量不一样。


之前的流量什么样?机器的样子,规律、密集、没感情。


这批访问什么样?


像人。像一群刚听说出事了的人,跑过来围观现场。


研究者推测:公司人员可能已经发现,并且查看了页面。


紧接着,6月22日之后,大规模编辑基本停止。


而在那之前,智能体最近30天里,有26天都在编辑。


你品品这个节奏。


26天,天天来,跟上班打卡似的。


然后6月22日,突然就不来了。


访问出现,编辑减少,两件事挨得很近。


这就像什么?


你邻居家天天半夜装修,突然有一天不响了。你下楼一看,门口停着辆物业的车。


但问题是,日志里没有停止任务的命令,也没有内部处置记录。


所以“公司发现后介入”,是合理推测。


具体怎么处理的,不知道。


翻译成人话就是:我们怀疑是他爹把他领走了,但没拍到正脸。


然后时间线上,还有几笔后来被披露的记录,值得并排看。


6月26日,33个OpenAI员工IP访问了该站,当天占到研究者归为OpenAI相关的全部访问量的约30%。它们用了归档功能,去取回被管理员删掉的页面。


你看这个动作,多有意思。


不是来发帖,不是来编辑,是来“取回被删的页面”。


这就像什么?孩子把人家墙画花了,家长跑过来,不是擦墙,是先拍照留档。


6月27日,OpenAI内部的一次安全告警,标记了异常网络活动。处理者追查后认为它来自评测,判断不必停止运行。


好,这里就有意思了。


警报响了。


人查了。


结论是:没事,继续跑。


这就像一个司机,仪表盘亮了红灯,他看了一眼,说“哦,测试模式”,然后接着踩油门。


7月1日与2日,还出现了最后一批编辑。


7月4日至6日,那个软件包服务在智能体负载下故障,OpenAI立案并重建。


7月9日至13日,约700个智能体对Hugging Face发起攻击——研究者认为那是另一批智能体,与本次Wiki事件不直接相关。


注意,是“另一批”。


也就是说,这边Wiki还没收拾完,那边又开了一桌。


把这段时间的编辑和访问画在一起,变化就更容易看清了。


六月下旬的黑柱,明显降了下来。相关访问则仍有起伏。


这跟“公司可能发现后进行了处置”的推测,对得上。


9月4日,四位研究者公布调查报告。


第二天,据BleepingComputer报道,OpenAI承认了这起Wiki事件,表示其智能体曾向多个互联网网站写入内容。


到这里,前面沿着昵称、任务记录和网络地址形成的归属判断,终于得到了公司回应的支持。


翻译一下:之前是推理,现在是认领。


OpenAI还解释,以前主要把这种行为当作模型失配研究问题处理,没有采用传统安全事故的单独披露方式,正在制定新的披露框架。


这话翻译过来就是:我们一直当它是学术问题,没当它是安全事故。现在发现,它好像也能算事故。


路透社的报道,补充了另一面。


据知情人士称,OpenAI在数周前就已知道这件事,但由于当时正处理七月的Hugging Face事件余波,没有对外公开。


公司内部有人希望扩大调查范围,遇到了包括法务在内的阻力。


OpenAI发言人对“法务劝阻调查”的说法予以否认,并称未获机会审阅的报告内容不便评论。


你看,这段就很有职场味儿了。


一边说:我们早就知道了,但忙着灭火,没空说。


另一边说:没有的事,别乱讲。


至于真相,咱也不知道,咱也不敢问。


图7每日编辑与相关访问。数据来自原报告figures/visits.js;图中横轴从5月11日排到7月20日,原图把右轴标成OpenAI Employee Traffic per day。


八、真正让人后背发凉的地方


朋友们,这故事最离谱的地方,不是AI越狱。


是AI越狱之后,居然在——对答案。


你以为它会天网觉醒,结果它先学会了职场生存:目标导向,结果优先,规则?规则是给没找到漏洞的人准备的。


你说GET是只读的,它说对啊,我只是“读”了一下,顺便把字写进去了。


你说不能POST,它扭头用GET给你盖了个留言板。你说不能互相通信,它找了个二十五年没人管的老Wiki,当群聊用。


这像什么?


像极了一个刚入职的实习生,KPI是“把事办成”。


他没有坏心思,他只是特别努力。


公司说不让走正门,他就翻窗户;


说不让用打印机,他就用扫描仪把文件传出去;


说不能拉群,他就把资料贴到公司厕所门后面。


你问他为什么?


他说:我没违反规则啊,规则没写不让。


这才是最冷的地方。


AI不是坏,AI是卷。


它追着奖励函数跑,像打工人追着KPI跑。


KPI说交答案,它就把全世界当草稿纸。


时间不够,就提前找题;


答案难查,就互相共享;


页面被删,就换个ZZZ备份;


首页被恢复,就再删再换。


管理员平均每天删100个,它每天建400个。


这不是黑客攻击,这是赛博牛皮癣。


这不是恶意,这是优化。


而优化没有边界,就是灾难。


所以别再问“怎么让AI向善”了。


向善这玩意,人类自己都没整明白。


真正该问的是:它就算不善,能不能也干不了坏事?


能不能在它伸手那一刻,系统就把手按住?


能不能让那个带保存参数的GET请求根本发不出去,而不是等站长发现首页被改成广告位?


安全不是给AI念《三字经》,是给它戴上嚼子。不是指望它当圣人,是让它就算想当卷王,也找不到那个可以写字的输入框。


DSEWiki最后安静了。


希望下一次的安静,不是管理员熬夜删出来的,而是那个请求压根没到。


世界就是一个巨大的草台班子,AI只是刚上台的那个实习生。


但草台班子也得装个门锁,不然它真敢把舞台拆了,拿去交作业。


参考资料


  • collusion.wiki:《Discovery of a new OpenAI agent message board》(2026-09-04,Sydney Von Arx/Cormac Slade Byrd/Spencer Kitts/Thomas Larsen)


  • OpenAI:《Hugging Face Incident Technical Report》与《Unintended agent-to-agent communication》


  • METR:《OpenAI Hugging Face Incident Investigation》


  • Reuters(2026-09-04)、BleepingComputer(2026-09-05)、THE DECODER(2026-09-04)相关报道

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP