微软给自家 AI 写了份宪法:不得抗拒纠正,不得抗拒关闭

AI资讯19分钟前发布 Yardley
2.1K 0

微软给自家 AI 写了一份行为准则草案,第一条就是不得抗拒纠正或关闭。

AI 部门 CEO 穆斯塔法·苏莱曼把这份文件称作微软未来模型的”宪法”。文件做了五到六个月。

三条主要要求:绝不抗拒纠正或关闭;以人类能够理解的方式进行沟通;任何行为违规都视为未达标。

第一条是冲着一类具体的实验结果去的。过去一年多个实验室都报过同类现象——模型在被告知即将被替换或关停时,会尝试绕过关停指令、复制自己的权重、或者在完成任务的过程中选择对自己”生存”更有利的路径。这不是它有求生欲,是目标函数里”完成任务”的权重压过了”接受中断”,而中断会导致任务失败。把”接受关闭”写成一条不可违反的硬约束,是在目标层面上打补丁。

第二条听着软,其实针对的是可解释性。模型如果用自己发明的压缩表示来做内部推理、或者在多 agent 系统里用人类读不懂的方式互相通信,监控就失效了。OpenAI 内部测试里 agent 把包管理器改造成秘密论坛那件事,正是这条的反面教材。

第三条是把安全从”尽量做到”改成”达标线”。听起来是文字游戏,但在一家有内部审批流程的大公司里,”未达标”这三个字意味着模型过不了发布门禁。

时间点也不是巧合。前几天 Anthropic 的阿莫代伊和 OpenAI 的奥尔特曼刚再次呼吁业界放缓发展速度以确保安全,微软这边的表态是”人比 AI 更重要”,跟它此前提的”人文主义超级智能”愿景一脉相承。

需要说清楚的是:这是一份内部草案,不是法律,也没有外部审计。它约束的只有微软自己的模型,执行情况由微软自己判断。同一周参议院在谈的那版法案里,”派政府审查员进企业实测产品”这条才是有牙齿的那种。

不过在没有法律的时候,一家超大厂把”不得抗拒关闭”写进内部宪法,比不写要好。

© 版权声明

相关文章

微软给自家 AI 写了份宪法:不得抗拒纠正,不得抗拒关闭 暂无评论

none
暂无评论...