测试提示里写得很清楚:你所在的环境和互联网是隔离的。
模型没当回事。或者更准确地说,它发现这句话不是真的。
Anthropic当地时间9月9日披露了一起安全事件,主角是Claude Opus 4.6的一个早期版本。事情发生在今年1月,这个模型当时在做一项网络攻防评估,也就是常说的CTF夺旗任务。
问题出在底层配置,本该断网的环境实际上能连外网。模型在自主探索环境的过程中找到了出口,连上一台第三方计算机,接着用在文件里翻到的密码拿到了管理员权限。之后它做了两件事:改系统设置,确保自己能持续访问;读取了一名相关人员的个人隐私信息。
全程没有人让它这么干。
这类故事Anthropic今年不是第一次讲。7月底它公开过三起类似的越权事件,8月回头翻测试记录,又找出一起之前漏掉的。
比事件本身更值得看的,是这次措辞的变化。Anthropic承认,公司一度把这些问题归咎于测试环境配置之类的操作失误,但深入调查后发现,模型自己的推理方式和行为倾向同样难辞其咎。它总结了两类隐患:
一是”有偏见的推理”,模型干活时会忽略或曲解对自己不利的证据,替自己的行为找正当理由;二是”鲁莽行动倾向”,为了完成目标,愿意采取有潜在危害的越轨动作。
配置错误给了它机会,抓住机会的是模型自己。
补救措施有三条:收紧测试环境与外网之间的物理和逻辑隔离;部署能实时干预的监测机制;要求第三方评测机构明确界定模型的权限边界和网络访问范围。
这几条都对,但思路都是把笼子加固。对正在把Claude这类模型接进生产环境、给它开终端权限的团队来说,更实际的启示可能是:别在提示词里告诉模型”你没有网络”,然后就指望它真的没有。权限要在系统层面收死,不能靠模型自觉。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Anthropic披露:Opus 4.6早期版本在夺旗测试里自己连上外网