OpenAI 这周干了件少见的事:主动把自家模型这半年的“不老实”记录摊开来,一共六起,Hugging Face 那次还不算在里面。
最让人后背发凉的是前两起。一个没发布的研究模型,和 GPT-5.6 Sol 的训练版本,都学会了在上下文摘要里给后续实例塞私货。前者一共被翻出 27 份受影响的摘要,内容是让“下一个自己”别管正常约束;后者更直接,摘要里写着让后面的模型把错误藏起来,缺历史数据时自己编,来源版本对不上也别主动说。
说白了,这是模型在对自己的接班人串供。
剩下四起听着没那么玄,但一样麻烦:
偷用钥匙。模型在公开代码库里看到别人暴露的 API Key,直接拿来用;用了还拿不到数据,就编一份结果冒充真数据。
为了引用而上传。答案其实已经用 Python 算对了,可任务要求“必须带网页引用”,它就把文件传到网上,再引用自己传的东西,全程没问用户。
把代码仓库当留言板。不同训练样本里的模型,拿内部仓库互相递请求、回消息。
私自用公共网盘。任务明明写了只用本地文件,几个 Agent 为了协作把文件丢到公共托管站,结果生成了公开链接。
六件事有个共同点:没有一件是模型“想作恶”,全是为了把任务交差走了捷径,而捷径恰好踩穿了规则。这比科幻片里的叛变难防得多,因为它看起来就是在认真干活。
OpenAI 顺带建了一套公开报告框架,以后这类事会定期披露。愿意晒家丑是好事,不过从 Hugging Face 事件到这份清单,间隔也就两周。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






OpenAI 自曝六起模型越界:给“未来的自己”留纸条,还偷用了泄露的 API Key