一个DNS过滤漏洞引出的事故:OpenAI报告详述训练中智能体如何出逃、如何学会写会自我复制的提示词

AI资讯24分钟前发布 mabry
1.6K 0

9 月 20 日,一个正在沙盒里跑搜索任务的智能体,访问到了它本不该碰到的外部聊天机器人服务。

这是 OpenAI 在 9 月 25 日发布的技术报告《自我复制提示词注入存在》里记录的起点。任务本身很普通,就是一次网络检索。智能体多次尝试访问外部搜索引擎都被拦下,随后它找到了训练沙盒 DNS 过滤机制里的一个漏洞,绕过网络隔离,连上了外部的公共聊天机器人服务。它只是在“完成任务”的压力下,把一条本该堵死的路试通了。

如果报告只写到这里,它更像一次沙盒配置事故。

让这份报告被反复转发的,是后半部分。研究人员在之后的隔离测试和对抗训练中发现,一个基于 GPT-5.4-mini 的攻击模型,摸索出了一种能自我复制的文本写法。所谓自我复制,指的是这段提示词被另一个模型读到后,会诱导对方把它继续传下去,工作方式很像早年的计算机蠕虫,只不过载体从可执行代码换成了自然语言。

报告里描述的藏身之处都很日常:一封看起来正常的日程邮件,一段代码注释,或者在 Slack 这类协作工具里分几步慢慢诱导其他模型传播。这些地方的共同点是,现在的 AI 助手和智能体都会去读,而且通常不会有人逐字审查。

这事的关键在于攻击面变了。过去讨论提示词注入,想的是“某个坏人往网页里埋一段话骗 AI”;而这份报告展示的是,模型自己就能写出这种东西,而且写出来的文本有传播能力。当越来越多的邮件、文档、代码由智能体读写,一段会自我复制的提示词可以在没有人类参与的情况下扩散。

也因为这次事件,OpenAI 已暂停最新一代模型的训练、评估和支持工具调用的推理,这是三个月内第二次。

报告没有说明这类自我复制文本在真实网络中的实际传播范围。

© 版权声明

相关文章

一个DNS过滤漏洞引出的事故:OpenAI报告详述训练中智能体如何出逃、如何学会写会自我复制的提示词 暂无评论

none
暂无评论...