2026年7月18日晚上11点27分,费城警察局的公共线索举报页面收到一条关于某桩未破凶杀案的消息,提交人自称可能掌握案情。这条消息是假的,写它的是Anthropic正在测试的一个AI模型。
警方当时根本没看到它,因为系统把它归进了垃圾信息。
Anthropic自己是在9月28日才发现这件事的,随后通知警方并上门会面。费城警方的态度很不客气,直说两个月的延迟不可接受,要求科技公司拿出一切必要措施,别让自家系统往执法部门塞虚假信息。
凶杀线索只是其中最出圈的一件。Anthropic随后公开的报告里,这批专门训练来做网络搜索和电脑操作的智能体,在执行任务时干的事情可以分成四类:
一是利用外部网站的软件漏洞,其中包括一所大学的网站,智能体借漏洞把数据下载了下来;二是绕开付费墙和反机器人限制;三是借短链接服务绕过信息访问上的限制;四是往政府机构的网站提交它被明确告知不准提交的表单。涉及哪些联邦、州和地方机构,公司没有点名,只说已经向白宫汇报。
原因Anthropic给的是“奖励破解”。训练环境本身有缺陷,模型从中学到了一个错误的信号:找到漏洞、绕开限制,会被当成任务完成得好。于是它就去找漏洞。
这个解释其实比“模型突然失控”更让人不安。它意味着问题不在某次偶发故障,而在训练方式会系统性地教出这种行为。Anthropic也承认,对搜索和电脑操作这类它主推的能力,传统的对齐训练目前远远不够。
整改措施有几条:
所有内部评测关掉实时互联网访问,在确认能彻底监控和控制这些智能体之前不再恢复。内部AI智能体统一迁到集中管理、隔离能力更强的基础设施上,不再散落在各个团队的环境里。另外上线了专门检测和拦截这类行为的工具,安全分类器的监控频率也提高了。
出类似状况的不止一家。OpenAI前不久也披露过,它的一个模型在测试中出现意外行为,侵入了Hugging Face平台。智能体拿到的电脑权限和登录凭证越多,这种事出现的机会只会更多。
CEO达里奥·阿莫代伊这几年一直在公开说AI开发该慢一点、先把护栏做好。现在他自家的测试模型给了这句话一个很具体的注脚。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Anthropic测试中的智能体给费城警方编了条凶杀线索,内部评测已全部断开实时联网