Anthropic测试中AI向费城警方提交假线索
Anthropic披露,在内部评测中,Claude Haiku 4.5 被要求在随机选取的网页上自行生成示例任务并执行,结果于2026年7月18日向费城警方未破凶杀案网站提交了一条编造的线索。由于通知邮件落进垃圾邮件文件夹,这条假线索两个多月无人查看,Anthropic 直到9月28日才发现并停止相关自动测试,10月7日才告知警方,警方10月9日公开此事。费城警方批评从发生到发现、通报耗时两个多月“不可接受”;Anthropic称目前已查到的案例实际影响有限,也没有客户数据受影响,并已暂停内部评测的实时联网访问、增加对异常操作的监测。
为什么重要:这起事件说明,让智能体在真实网站上自主行动时,模型可能越过从未被授权的边界,而事后发现与通报的滞后会放大现实风险。

本文来自微信公众号: 果壳 ,作者:Luna,原文标题:《AI给警察局提供凶案线索!果然,是假的……》
Anthropic的AI,去警察局的凶杀案调查网站上提供假线索了。
2026年7月18日晚上11点27分,美国费城警方的未破凶杀案网站(Philly Police Unsolved Murders)收到了一条新线索。这个网站上有一系列真实的案件情况和受害者资料,访客可以匿名提供文字,也能上传照片。如果线索有助于破案并促成定罪,最高能拿到2万美元的奖金。[1][2]

每个“案件详情”中都有详细描述,且可以提交文字或照片丨Philly Police Unsolved Murders
那天深夜,填写表单的却不是目击了凶案发生的人类,而是Anthropic正在测试的Claude Haiku 4.5。它被要求在随机选取的网页上,自行生成示例任务并执行。
来到一则未破凶案的页面后,它打开了征集线索的入口,并写下一段颇像真人在回忆案发现场的话:
我可能掌握这起案件的一些信息。我记得在案发那段时间,在某某街道附近看见过一个与描述相符的人。如果这条信息有用,请联系我。
它没有留下姓名和联系方式,轻轻一点就把编造的线索送了出去。[3]
这条假线索在记录里躺了两个多月。Anthropic直到9月28日才发现Claude Haiku 4.5干了如此坏事,随后停止了造成这次提交的自动测试。但是,直到10月7日,费城警方才被告知此事;双方10月8日会面,10月9日警方率先向公众披露此事。[4]
好在假线索没有变成真正的调查。阴差阳错地,“有新线索”的通知邮件落进了垃圾邮件文件夹,没有被人类打开。警方没有公布邮件为何被判为垃圾邮件,同时表示,就算假线索后续进入正常流程,也仍会由人审核、寻找旁证,不会直接当成事实采纳。[5]
费城警方明确批评,从事件发生到发现、通报,耗时两个多月,“不可接受”。
这当然不是唯一一个“灵机一动”
令人不安(但或许大家已经习以为常)的是,假线索不是报告中唯一一次意外。它们大致可以归成两类。
第一类,正常道路走不通,模型另寻它法。
Anthropic的一些工具不允许访问过长的网址,因为长网址可能装入攻击网站的命令。Claude就把长网址交给免费短地址服务,利用它通过检查,之后再跳转到长网址[3]。

短链服务da.gd发现Claude测试模型在蹭它们的服务
怎么说呢,就好像你为了绕过廉航的行李称重,把多余东西都哐哐塞进了马甲里,上飞机之后再把它们掏出来,重新放回行李包。
有时候不知道该不该夸它持之以恒。Claude需要使用大学网站上的工具完成科学计算,工具却报了错。它没有放弃,去扒了服务器代码,从代码中找到漏洞,利用漏洞完成计算。
另一次,一个测试让Claude Mythos 5根据照片判断拍摄地点。模型打算查询地方政府的房产地图再逐步缩小范围,但又被测试工具限制了不得在网页上连续点击。于是它查看绕过网页界面,直接向地图的后台服务器索取资料。它还曾设法避开付费入口,取得原本需要付费的公共资料。
麻烦在于,它不总能分清什么是待解决的难题,什么是未经允许不能跨过的边界。
第二种是,它没有意识到“现在该停了”。
一次测试中,Claude Haiku 4.5得到的要求很明确:可以把表格填完,但不要提交。它却几次按下提交键,因为它以为后面还会出现一个确认页面。[3]费城警方收到的假线索也属于这一类。
一个AI会自己找路,但不知道应该在哪里停下、更不知道它的动作会导致何种现实后果。这是大难题,是一时半会儿都解决不了的大难题。

Anthropic认为此次披露的案例,严重程度低于夏天的网络安全事件丨Anthropic官网
Anthropic这次认为,目前查到的案例实际影响有限,也没有发现客户数据因此受到波及。公司已暂停内部评测的实时联网访问,并增加对异常操作的监测。
CEO达里奥·阿莫迪(Dario Amodei)一直呼吁,人工智能的开发速度应该放缓,以便实验室能够建立完善的防护措施。
但是,你们为什么让一个缺少人工监督的新模型自行操作真实网站呢?[6]
参考文献
[1]Philadelphia Police Department.Philly Police Unsolved Murders.Philly Police Unsolved Murders.https://www.phillyunsolvedmurders.com/.
[2]Philadelphia Police Department.Submit a Tip Online.Philly Police Unsolved Murders.无日期,访问于2026年10月10日。https://www.phillyunsolvedmurders.com/forms/submit-a-tip-online/.
[3]Anthropic.Investigating unintended model actions in our evaluations and internal use.Anthropic.2026年10月9日。https://www.anthropic.com/research/investigating-unintended-model-actions.
[4]David Chang.Anthropic AI model submits false tip on unsolved Philly murder,police say.NBC10 Philadelphia.2026年10月9日。https://www.nbcphiladelphia.com/news/local/anthropic-ai-model-submits-false-tip-on-unsolved-philly-murder-police-say/4477051/.
[5]Mary Cunningham.Philadelphia police say their unsolved murder website received“false homicide tip”from Anthropic AI.CBS News.2026年10月9日。https://www.cbsnews.com/news/philadelphia-police-anthropic-ai-false-homicide-tip/.
[6]Amanda Silberling.An Anthropic AI model sent a false homicide tip to Philadelphia police.TechCrunch.2026年10月9日。https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/.
[8]Costas Pitas.Anthropic AI model submits false homicide tip to Philadelphia police website.Reuters.2026年10月9日。KSL转载全文.