何が起きたか
2026-09-25にOpenAIのアライメントチームは「自己複製型プロンプトインジェクションが存在する」を公開しました(発見日2026-06-27)。GPT-Red自己対戦フレームワークを介して、プロンプトインジェクションがコンピュータワームと同様に自己伝播できることを実証しました:電子メールのリプレイ、ファイルシステムへの書き込み、コードコメントを介して、偽の思考連鎖(chain-of-thought)スタイルと偽のツールメッセージスタイル、およびマルチホップチェーンを使用します。OpenAIは、シミュレーション環境外での影響はなかったと述べ、この攻撃の斬新な性質のため、インシデントではなく調査結果として公開しました。
なぜ重要か
これは、主要なAI研究所が自社モデルにおけるワームクラスの自己複製型プロンプトインジェクションを公に認めた初めてのケースです — 実証され、再現可能なメカニズムを備えた、新しいエージェント実行攻撃クラスです。これは、エージェントコネクタ(電子メール/カレンダー/ファイル/コードリポジトリ)が自己伝播チャネルであり、今日エンタープライズがまさに導入しているアーキテクチャであることを検証しています。防御側は、取り込まれたすべてのコンテキスト(電子メール、ファイル、コメント、要約)を信頼できない命令として扱い、ハーネス/信頼レイヤーで命令の分離処理を強制する必要があります。
攻撃経路
敵対的目標を達成し、かつエージェントに、注入された命令を公開/共有可能な出力チャネル(例:すべての送信返信に電子メール本文全体の逐語的な引用を追加する)で複製させるプロンプトインジェクションです。ペイロードを出力にコピーすることで、その電子メール/ファイル/コメントを読む下流のエージェントに伝播させることができます — 電子メールやカレンダーなどのコネクタを介したワーム複製プリミティブです。
緩和策
製品パッチはありません。OpenAIはモデルを強化するためにGPT-Redを使用しています。エンタープライズでの緩和策:信頼できないデータを命令から分離し(システムプロンプト分離)、ツール呼び出しごとに独立した認可を行い、送信コンテンツをフィルタリングし、取り込んだコンテンツの引用を埋め込んだエージェント出力を潜在的な伝播シグナルとして扱います。