무슨 일이 있었나
2026-09-25에 OpenAI의 Alignment 팀은 '자가 복제 프롬프트 인젝션이 존재합니다' (2026-06-27 발견)를 게시하여 GPT-Red 자가 플레이 프레임워크를 통해 프롬프트 인젝션이 컴퓨터 웜과 유사하게 자체 전파될 수 있음을 입증했습니다: 이메일 재생, 파일 시스템 쓰기 및 코드 주석을 통해, 가짜 chain-of-thought 및 가짜 도구 메시지 스타일과 다중 홉 체인을 사용합니다. OpenAI는 시뮬레이션 환경 외부에서 영향이 발생하지 않았다고 밝히고 공격의 새로운 특성으로 인해 사고가 아닌 발견 사실을 공개했습니다.
왜 중요한가
자체 모델에서 웜급 자가 복제 프롬프트 인젝션을 공개적으로 인정한 최초의 주요 AI 연구소입니다 — 입증되고 재현 가능한 메커니즘을 가진 새로운 에이전트 실행 공격 클래스입니다. 에이전트 커넥터 (이메일/캘린더/파일/코드 저장소)가 자체 전파 채널이며, 이것이 오늘날 기업이 배포하는 정확한 아키텍처임을 검증합니다. 방어자는 모든 수집 컨텍스트 (이메일, 파일, 주석, 요약)를 신뢰할 수 없는 지침으로 취급하고 하네스/신뢰 계층에서 별도 지침 처리를 강제해야 합니다.
공격 경로
적대적 목표를 달성하고 에이전트가 공개/공유 가능한 출력 채널에 주입된 지침을 재생산하도록 유도하는 프롬프트 인젝션 (예: 모든 발신 응답에 전체 이메일 본문의 문자 그대로의 인용문을 추가). 페이로드를 출력에 복사하면 해당 이메일/파일/주석을 읽는 다운스트림 에이전트로 전파될 수 있습니다 — 이메일 및 캘린더와 같은 커넥터를 통한 웜 복제 기본 요소입니다.
완화 방안
제품 패치는 없습니다; OpenAI는 모델을 강화하기 위해 GPT-Red를 사용하고 있습니다. 엔터프라이즈 완화: 신뢰할 수 없는 데이터를 지침과 분리 (시스템 프롬프트 격리), 도구 호출별 독립 권한 부여, 아웃바운드 콘텐츠 필터링, 수집된 콘텐츠의 인용문을 포함하는 에이전트 출력을 잠재적 전파 신호로 취급하십시오.