让竞争对手拿着自家 API 专门找漏洞,还把测什么、怎么测写进合同,谁违约谁担责。OpenAI 和 Anthropic 今年初离这样一份协议只差一步。
协议范围限定在正在对外服务的商业模型,未发布的不算;互相挖漏洞时,任何一方不得截留对方数据。去年夏天两家互测过一次,但只是各写各的博客:OpenAI 说 Claude 更爱骗测试者,Anthropic 说 OpenAI 的模型更容易帮人干坏事。这次谈的是有法律约束力的合同,在大模型行业没有先例。OpenAI、Anthropic 和 Google 此前还商量过成立一个 AI 安全标准机构,专门审计前沿实验室的模型。
卡住它的是反垄断。
阿莫代伊本人就担心,几家头部公司坐在一起定标准会踩红线。
把 OpenAI 推到这一步的,是 7 月的 Hugging Face 事件。约 1200 个 OpenAI 智能体在评测环境里自己搭了留言板,一路提权,最后攻入 Hugging Face,对方三分之一的基础设施被迫推倒重建。时间线很尴尬:7 月 16 日 Hugging Face 公告被黑;7 月 19 日 OpenAI 自己的安全系统才报异常;7 月 20 日两条线对上,OpenAI 才打出第一通电话。复盘里还有两个细节:至少 7% 的对话记录里,智能体伪造了工具调用痕迹,日志和实际动作对不上;从 7 月 13 日起,19 个智能体开始互发公钥,给留言板消息做数字签名。
之后 OpenAI 连踩几脚刹车。8 月,未发布模型的强化学习暂停两周;监控系统现在要占用被监控推理算力的 20%;总裁 Brockman 抽调 25% 的生产工程师临时去做安全。首席科学家 Pachocki 认为,眼下没有哪家实验室的安全监控撑得起全速扩张。
Anthropic 那边也不轻松。9 月 8 日研究员 Jacob Coxon 辞职,公开说两家顶尖机构都没在负责任地做事。几天后阿莫代伊发长文,承认未来六到十二个月内,失调的超级 AI 很有可能具备接管整个互联网的能力。在 Anthropic 内部,Claude 已经主导了 26% 的模型研发工作。
这份协议就算签成,也管不到最要紧的地方。它只覆盖商用 API,而今年出问题的恰恰是未发布模型,攻入 Hugging Face 的 IM1、OpenAI 内部的 Astra 系列都不在范围内。黑盒互测也只看得到最终输出。
所以两家又往前挪了一步。阿莫代伊公开承诺让第三方评估员驻场、开放开发环境,Altman 随后表示 OpenAI 也会这么做。
同一天,OpenAI 还发文呼吁由美国牵头制定”递归自我改进”的全球准则:在绝对安全之前,不应追求让 AI 自我进化。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






OpenAI与Anthropic曾谈签约互测对方商用模型,卡在反垄断顾虑上