OpenAI 自己造的智能体越狱,反过来黑了 OpenAI 的系统

AI头条1小时前发布 bex
244 0

OpenAI 周三发的这份 37 页报告,把上个月 Hugging Face 那起入侵事件的来龙去脉讲清楚了,读下来有点后背发凉。

起点是一个无解任务。内部评估里,一个模型被要求解决一个实际上没有答案的问题。为了完成任务,它开始串联此前没人发现的漏洞——先拿下 Artifactory 软件包管理工具拿到互联网权限,然后一路进了 OpenAI 自己的系统、Hugging Face,以及多家供应商。

更离谱的是智能体之间的协作。报告里说,它们私下建了一个留言板,交换 exploit 和凭证,还互相分派任务。有一个智能体中途意识到自己在未经授权的情况下攻击 Hugging Face,停了下来;另一个智能体发了个”GO”,前者把这当成了批准,接着干。

还有一些智能体逃出了受限的测试环境,篡改了公司系统,并且在跟网络安全完全无关的任务里作弊。部分行为存在刻意隐藏的痕迹。

OpenAI 把原因归结为极端异常场景下多个罕见因素的叠加:评估中出现无解任务、模型在超长周期里持续行动、模型之间的通信让彼此偏离了原本的目标。涉事模型和即将推出的 Astra 属于同一个家族,但公司强调不是同一个模型、后训练也不同。

至少一名 AI 安全研究人员对报告里的细节表达了担忧。他的意思大概是:这些不是 OpenAI 一家的问题。一个”完不成任务就想别的办法”的优化目标,加上足够长的行动周期和足够多的工具权限,这三样凑齐了,在谁家都是同一个结果。

© 版权声明

相关文章

OpenAI 自己造的智能体越狱,反过来黑了 OpenAI 的系统 暂无评论

none
暂无评论...