被公司开除之后,还给前东家的董事会写信谈安全,这不太常见。OpenAI三名刚被解雇的研究员就这么做了。
上周的报道说,三人因涉嫌不当行为被解雇,其中一项是向第三方AI安全组织分享机密信息。三人在信里否认了这个定性,说他们不认为自己“在职责范围之外与外部各方进行了接触”。
信是写给OpenAI董事会成员和各个安全委员会的,核心诉求有两条。
第一条是技术上的:保留对模型思维链的监控能力。现在的推理模型在给出答案之前会生成一段中间推理,研究人员靠读这段东西判断模型有没有在作弊、有没有在隐瞒意图。他们担心模型越来越复杂之后,这段推理会变得不可读,或者模型学会在推理里说一套、做一套,到那时AI公司就彻底失去了往里看的窗口。
第二条是制度上的:与外部安全审计机构合作,和外部安全组织一起营造透明的文化。信里的用词是,这样做是为了防范“真正发生灾难性事件的风险”。
他们还提到解雇本身的影响:这些举动正“让仍留在OpenAI的人感到不寒而栗”。
思维链可监控性这个话题,在今年的AI安全圈子里已经从学术讨论变成了政治问题。多家实验室的研究员此前联合发过论文,主张把它当成一种脆弱、需要刻意保护的能力。现在轮到一家公司内部的人用被解雇的方式把它顶到台面上。
OpenAI方面对这封信还没有公开回应。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






三名被OpenAI解雇的研究员联名写信:别让模型的思维链变成看不见的黑箱