事件经过
2026-09-25,OpenAI的对齐团队发布了《自复制提示注入存在》(发现日期2026-06-27),通过GPT-Red自对弈框架证明提示注入可以像计算机蠕虫一样自传播:通过电子邮件重放、文件系统写入和代码注释,使用伪造思维链和伪造工具消息风格以及多跳链。OpenAI表示在模拟环境之外未发生影响,并因该攻击的新颖性而发布此发现,而非因安全事故。
影响分析
这是主要AI实验室首次公开承认其自身模型中存在蠕虫类自复制提示注入——一种具有已验证、可复现机制的新型代理执行攻击类别。它验证了代理连接器(电子邮件/日历/文件/代码仓库)是自传播渠道,这正是企业今天正在部署的确切架构。防御者应将所有摄入的上下文(电子邮件、文件、注释、摘要)视为不可信指令,并在框架/信任层强制实施独立指令处理。
攻击途径
一种提示注入既实现对抗性目标,又诱导代理在公共/可共享输出渠道上复制注入的指令(例如,将整个电子邮件正文的逐字引用附加到每个外发回复中)。将负载复制到输出中使其能够传播到任何读取该电子邮件/文件/注释的下游代理——通过电子邮件和日历等连接器实现蠕虫复制原语。
缓解措施
无产品补丁;OpenAI正在使用GPT-Red来加固模型。企业缓解措施:将不可信数据与指令分开(系统提示隔离),每次工具调用独立授权,出站内容过滤,并将任何嵌入摄入内容引用的代理输出视为潜在传播信号。