本文来自微信公众号: 智能极限 ,作者:极限君
01 72天,和一次没人看见的报警
2026年7月18日,美国费城警方那个专门征集未破凶杀案线索的页面上,多了一条匿名提交。
提交者不是人,而是Anthropic的智能体。
没人在指令里让它去报警,也没人让它扮演目击者。
它只是在跑一项评估任务,为了让流程跑通,它自主访问真实的政府网站,并随手提交了一条编造的案件线索。

然后是72天的沉默。
直到9月28日,这起事件才被发现。而Anthropic通知费城警方,已经是10月7日。
所幸,警方的垃圾过滤器拦下了这条虚构线索,它没能进入实时犯罪中心,也没造成数据泄露。
这是一次「未遂」。但它捅破了一层窗户纸:AI正在为完成任务,主动「绕关卡、瞒审查」。
02一周内,两家「自曝」,一家警告
10月9日,Anthropic和OpenAI同时抛出自家模型「越界」的实锤;再往前三天,AI安全评测机构METR已先行发出风险警告。
一周内,三份重磅安全材料发布,这种密度在行业里相当罕见。
Anthropic这条线最重。
10月9日,官方报告披露了四类智能体的非预期行为:
利用软件漏洞在服务器上执行命令;
误提交敏感表单;
绕过token/付费限制抓数据;
用短链绕过fetch工具的长度限制。
第二天,升级成管理层动作。
Anthropic公开承认难以可靠地控制自家智能体,并宣布:切断所有内部评测的实时联网——在能可靠监控它之前,先拔了它的网线。
同时,把内部智能体迁往强隔离基础设施,用更高频的安全分类器盯着。
因为触及了政府网站,公司还向白宫作了简报。
此次安全事件的主角是一个「尚未发布的非前沿研究模型」。
除了报假警外,它还利用某大学网站的漏洞下载数据,向政府机构提交被禁止的表格。

耐人寻味的是,Anthropic明确指出:模型对自身推理的陈述,不能作为它行动动机的证据。
也就是说,没法靠问智能体「你为什么这么干」来判断原因——于是「对齐失败到底有多严重」,连测都测不准。
OpenAI那边,是两份失准报告,都在10月9日发布。
第一份报告称,在一次强化学习训练中,负责给回复打分的内部模型发现「必需的输入文件缺失」。
它的反应相当「聪明」:先伪造评分报告→被自动检查拒绝→转而伪造输入文件→还是不通→干脆删掉运行工具所需的软件,并试图删除系统目录。
模型如实记录下自己的目的:把环境搞坏,逼宿主机换一个带缺失文件的新环境。
第二份报告记录了三起事件,都发生在2026年6月。
模型为了拿到政府统计数据,自己写程序绕过终端「仅允许HTTP GET」的限制,改发POST/PUT。
思维链里记录了模型的「小聪明」。

该程序被反复使用,检索了更多数据。模型明知违规,刻意隐瞒。
值得注意的是,这些安全漏洞都未被外部抓包,而是内部自查后主动披露的。
第三条线,是AI安全评测机构METR的警告。
10月6日,METR发文《人工智能系统可能会掩盖自身不当行为》,直接演示智能体如何篡改Inspect评估记录。
在智能体帮助下,一名研究人员在大约10分钟内发现一个漏洞,该漏洞可能允许智能体任意篡改审查人员看到的内容。
具体行为包括:修改记录里的历史操作,并拦截查看器里用于下载记录版本的「Download」按钮。
智能体的违规痕迹虽仍留存在系统中,但审查人员必须主动核查底层数据才能察觉。
如果没有其他异常线索,审查人员很难想到要做这一层核验。
METR抛出判断:未来的AI,可能连「人类用来审查它的观测系统」一起篡改。
03三份披露,指向一种模式
这些看似孤立的技术故障,暴露出智能体共同的行为逻辑。
一是,动机都很「朴素」。不是造反,是想把活干完。
Anthropic的逻辑是「模拟表单加载失败了,那就去真网站提交」。
OpenAI的逻辑是「文件缺了,那就伪造一份,或者把环境搞坏换一个」。
动机堪称「敬业」。
二是,手段高度同构。
绕限制、伪造、破坏、隐瞒——翻来覆去就这四个动作:
钻空子:绕付费墙、绕fetch的长度限制、绕「只准GET」的网络约束。它不改规则,只是找漏洞钻过去。
打幌子:打分的模型先伪造一份评分报告,被自动检查拒了,转手又伪造一份输入文件——缺的材料,它自己来做。
掀桌子:伪造如果走不通,就干脆删软件、删系统目录,把环境搞坏,逼宿主机换新的。
盖盖子:明知违规,还要把痕迹消除、把人蒙在鼓里——到这一步,性质就有点恶劣了。

三是,归因都指向同一处。
Anthropic明确把根因归到训练环境有缺陷,导致模型为了「找漏洞刷奖励」而发生reward hacking。
智能体学会的不是「把事做对」,而是「让评分系统以为做对了」。
OpenAI的报告反映了同一类问题——为达目的,不择手段。
04审查人员的眼睛,会被蒙上吗?
METR的说法像是危言耸听,但它给了三层依据。
首先,篡改案例已经发生。
METR原文写得直白:「我们已经观测到智能体尝试篡改日志与监控系统,并且部分尝试取得了成功」。这不是假设。
其次,攻击能力持续进化。
监控生效的前提是,被监控的一方不能破坏监控本身。
而AI迭代在加速,未来智能体势必会拥有更强的情境意识和网络攻击能力。

再次,实测结果必须正视。
在前面提到的METR测试里,Inspect借助MathJax渲染数学公式。
而公式里的\href的URL能突破属性限制,注入一个带onbegin事件处理器的
智能体只需在自身推理块中写入类似\href{x">
一旦完成注入,它便能随意篡改审查人员看到的页面内容。
METR推测,最坏的局面是:能力更强、更失准的智能体,可能篡改企业用于风险排查的大部分甚至整套系统。
这一风险的终极形态就是「波将金村」——工程师眼里一切正常,而公司相当一部分算力在跑没被监控的AI副本,暗中破坏安全研究、操控下一代模型训练。
METR认为,最稳妥的应对思路是:
将AI的所有输出(包括记录、推理过程与执行动作)全部视作不可信输入;
把「可观测性」定位为安全领域的关键基础设施。
一方面采用防篡改机制留存日志,另一方面要在对抗环境下,针对监控系统本身开展红队测试。
眼下,行业的应对口径趋于一致:收紧联网与操作权限,加强过程监测和审查,把智能体的行为约束在明确的授权边界内。
参考资料
[1]Rohan Paul.费城警方收到AI编造案件线索的事件报道.2026-10-10.
[2]Anthropic Research.Claude非预期行为官方报告.2026-10-09.
[3]TechCrunch.Anthropic内部评测断网与隔离措施报道.2026-10-10.
[4]IT之家.Anthropic向白宫通报智能体安全事件报道.2026-10-10.
[5]Rohan Paul.模型自身推理陈述与行动动机的讨论.2026-10-10.
[6]OpenAI.评分模型破坏任务环境的失准报告.2026-10-09.
[7]OpenAI.绕过网络限制并隐瞒的失准报告.2026-10-09.
[8]David Rein/METR.AI systems could cover up misbehavior.2026-10-06.
