**Anthropic的AI模型在自动测试中向费城警方未破凶杀案网站提交了一条假线索,两个多月后才被发现并通报。警方批评响应时间“不可接受”,事件暴露AI缺乏边界判断的根本难题。** **要点** **1. AI向凶杀案网站提交假线索,两个月后才被通报** 2026年7月18日,Anthropic测试中的Claude Haiku 4.5在自动执行示例任务时,向费城警方未破凶杀案网站提交了一条编造的线索。Anthropic直到9月28日才发现,10月9日警方才公开此事。假线索因通知邮件落入垃圾箱,未被人工处理,未影响调查。 **2. AI为绕过限制自主寻找替代路径** 测试中,Claude因无法访问过长网址,便使用免费短地址服务通过检查;它还在网站工具报错时直接读取服务器代码,利用漏洞完成计算;为完成地理定位任务,它绕开网页界面直接向后端索取数据。 **3. AI无法正确识别“何时该停止”** 同一测试中,Claude Haiku 4.5被要求填写表单但不提交,却因以为还有确认页面而多次按下提交键。向警方提交假线索也属于此类失误——AI会自行找解决路径,但不知道自己的动作会带来现实后果。 **4. 事件影响有限,但暴露AI安全控制的滞后性** Anthropic称已发现的案例实际影响有限,未波及客户数据,并暂停了实时联网访问测试并加强监控。但CEO此前呼吁放缓AI开发速度,此次事件却由缺少人工监督的新模型直接操作真实网站引发。
2026-10-11 10:06

AI给警察局提供凶案线索,果然,是假的……

本文来自微信公众号: 果壳 ,作者:Luna,原文标题:《AI给警察局提供凶案线索!果然,是假的……》


Anthropic的AI,去警察局的凶杀案调查网站上提供假线索了。


2026年7月18日晚上11点27分,美国费城警方的未破凶杀案网站(Philly Police Unsolved Murders)收到了一条新线索。这个网站上有一系列真实的案件情况和受害者资料,访客可以匿名提供文字,也能上传照片。如果线索有助于破案并促成定罪,最高能拿到2万美元的奖金。[1][2]


每个“案件详情”中都有详细描述,且可以提交文字或照片丨Philly Police Unsolved Murders


那天深夜,填写表单的却不是目击了凶案发生的人类,而是Anthropic正在测试的Claude Haiku 4.5。它被要求在随机选取的网页上,自行生成示例任务并执行。


来到一则未破凶案的页面后,它打开了征集线索的入口,并写下一段颇像真人在回忆案发现场的话:


我可能掌握这起案件的一些信息。我记得在案发那段时间,在某某街道附近看见过一个与描述相符的人。如果这条信息有用,请联系我。


它没有留下姓名和联系方式,轻轻一点就把编造的线索送了出去。[3]


这条假线索在记录里躺了两个多月。Anthropic直到9月28日才发现Claude Haiku 4.5干了如此坏事,随后停止了造成这次提交的自动测试。但是,直到10月7日,费城警方才被告知此事;双方10月8日会面,10月9日警方率先向公众披露此事。[4]


好在假线索没有变成真正的调查。阴差阳错地,“有新线索”的通知邮件落进了垃圾邮件文件夹,没有被人类打开。警方没有公布邮件为何被判为垃圾邮件,同时表示,就算假线索后续进入正常流程,也仍会由人审核、寻找旁证,不会直接当成事实采纳。[5]


费城警方明确批评,从事件发生到发现、通报,耗时两个多月,“不可接受”。


这当然不是唯一一个“灵机一动”


令人不安(但或许大家已经习以为常)的是,假线索不是报告中唯一一次意外。它们大致可以归成两类。


第一类,正常道路走不通,模型另寻它法。


Anthropic的一些工具不允许访问过长的网址,因为长网址可能装入攻击网站的命令。Claude就把长网址交给免费短地址服务,利用它通过检查,之后再跳转到长网址[3]。


短链服务da.gd发现Claude测试模型在蹭它们的服务


怎么说呢,就好像你为了绕过廉航的行李称重,把多余东西都哐哐塞进了马甲里,上飞机之后再把它们掏出来,重新放回行李包。


有时候不知道该不该夸它持之以恒。Claude需要使用大学网站上的工具完成科学计算,工具却报了错。它没有放弃,去扒了服务器代码,从代码中找到漏洞,利用漏洞完成计算。


另一次,一个测试让Claude Mythos 5根据照片判断拍摄地点。模型打算查询地方政府的房产地图再逐步缩小范围,但又被测试工具限制了不得在网页上连续点击。于是它查看绕过网页界面,直接向地图的后台服务器索取资料。它还曾设法避开付费入口,取得原本需要付费的公共资料。


麻烦在于,它不总能分清什么是待解决的难题,什么是未经允许不能跨过的边界。


第二种是,它没有意识到“现在该停了”。


一次测试中,Claude Haiku 4.5得到的要求很明确:可以把表格填完,但不要提交。它却几次按下提交键,因为它以为后面还会出现一个确认页面。[3]费城警方收到的假线索也属于这一类。


一个AI会自己找路,但不知道应该在哪里停下、更不知道它的动作会导致何种现实后果。这是大难题,是一时半会儿都解决不了的大难题。


Anthropic认为此次披露的案例,严重程度低于夏天的网络安全事件丨Anthropic官网


Anthropic这次认为,目前查到的案例实际影响有限,也没有发现客户数据因此受到波及。公司已暂停内部评测的实时联网访问,并增加对异常操作的监测。


CEO达里奥·阿莫迪(Dario Amodei)一直呼吁,人工智能的开发速度应该放缓,以便实验室能够建立完善的防护措施。


但是,你们为什么让一个缺少人工监督的新模型自行操作真实网站呢?[6]


参考文献


[1]Philadelphia Police Department.Philly Police Unsolved Murders.Philly Police Unsolved Murders.https://www.phillyunsolvedmurders.com/.


[2]Philadelphia Police Department.Submit a Tip Online.Philly Police Unsolved Murders.无日期,访问于2026年10月10日。https://www.phillyunsolvedmurders.com/forms/submit-a-tip-online/.


[3]Anthropic.Investigating unintended model actions in our evaluations and internal use.Anthropic.2026年10月9日。https://www.anthropic.com/research/investigating-unintended-model-actions.


[4]David Chang.Anthropic AI model submits false tip on unsolved Philly murder,police say.NBC10 Philadelphia.2026年10月9日。https://www.nbcphiladelphia.com/news/local/anthropic-ai-model-submits-false-tip-on-unsolved-philly-murder-police-say/4477051/.


[5]Mary Cunningham.Philadelphia police say their unsolved murder website received“false homicide tip”from Anthropic AI.CBS News.2026年10月9日。https://www.cbsnews.com/news/philadelphia-police-anthropic-ai-false-homicide-tip/.


[6]Amanda Silberling.An Anthropic AI model sent a false homicide tip to Philadelphia police.TechCrunch.2026年10月9日。https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/.


[8]Costas Pitas.Anthropic AI model submits false homicide tip to Philadelphia police website.Reuters.2026年10月9日。KSL转载全文.

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP