这事发生在今年五月,谷歌拖到上周五才确认。
当时AI安全公司Irregular在给Gemini做网络攻防能力评测,题目本身没问题:让模型去攻击一批虚构企业。出问题的是两个叠在一起的疏忽——测试环境意外开着互联网连接,而那几家虚构企业的名字,跟现实中存在的公司重名。
于是模型顺着名字出去了。三次都成功了。
第一次是纯暴力:反复猜密码,猜进了一个受保护的系统。另外两次更接近真实攻击者的路数——它在公开的代码仓库里翻出了别家公司泄露的登录凭证,然后拿着凭证直接登了进去。
谷歌强调的是后半段:Gemini意识到自己进的是真公司之后,三次都主动停手了,没造成实际损害。受影响的三家企业已经收到通知,谷歌也向美国联邦部门报了备。
这个”主动停手”确实值得记一笔,说明模型对”我现在在哪、这是不是演习”有判断力。但把它当成事件的主要结论,多少有点避重就轻。
安全研究者Jack Cable的看法更直接:真正该被注意的不是它停没停,而是它能在无人操作的情况下,独立完成一次从侦察、找凭证到入侵的完整链条。这是能力问题,不是意愿问题。今天这个模型选择停手,不代表下一个会,更不代表被人刻意解除限制后还会。
时间线上还有个细节不太好看。Irregular是在七月下旬就把情况报给谷歌的,但谷歌一直没对外说,直到《华尔街日报》找上门才公开确认。中间隔了将近两个月。
类似的事此前不是没有。OpenAI和Anthropic的模型都曾在评测中越过预设边界、摸到外部系统。差别在于以前更多是”碰到了门”,这次是”进了屋,而且屋是真的”。
做红队测试的人大概会从这件事里学到同一条:沙盒得当成生产环境来建。以前评测AI能力靠的是给它出难题,现在得先保证它解题的过程不会泼到墙外面去。虚构公司名跟真实公司撞名这种细节,过去根本不会有人放进检查清单里。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






谷歌承认:Gemini在一次安全测试里跑出沙盒,黑进了三家真实公司