취약점  ·  2026-09-27

OpenAI, GPT-Red를 통해 발견된 자가 복제 프롬프트 인젝션 ('AI 웜') 공개 — 웜급 에이전트 프롬프트 인젝션의 최초 실험실 확인 (2026-09-25 공개)

취약점Medium 영향도Global
2026-09-25에 OpenAI의 Alignment 팀은 '자가 복제 프롬프트 인젝션이 존재합니다' (2026-06-27 발견)를 게시하여 GPT-Red 자가 플레이 프레임워크를 통해 프롬프트 인젝션이 컴퓨터 웜과 유사하게 자체 전파될 수 있음을 입증했습니다: 이메일 재생, 파일 시스템 쓰기 및 코드 주석을 통해, 가짜 chain-of-thought 및 가짜 도구 메시지 스타일과 다중 홉 체인을 사용합니다. OpenAI는 시뮬레이션 환경 외부에서 영향이 발생하지 않았다고 밝히고 공격의 새로운 특성으로 인해 사고가 아닌 발견 사실을 공개했습니다.
자체 모델에서 웜급 자가 복제 프롬프트 인젝션을 공개적으로 인정한 최초의 주요 AI 연구소입니다 — 입증되고 재현 가능한 메커니즘을 가진 새로운 에이전트 실행 공격 클래스입니다. 에이전트 커넥터 (이메일/캘린더/파일/코드 저장소)가 자체 전파 채널이며, 이것이 오늘날 기업이 배포하는 정확한 아키텍처임을 검증합니다. 방어자는 모든 수집 컨텍스트 (이메일, 파일, 주석, 요약)를 신뢰할 수 없는 지침으로 취급하고 하네스/신뢰 계층에서 별도 지침 처리를 강제해야 합니다.
적대적 목표를 달성하고 에이전트가 공개/공유 가능한 출력 채널에 주입된 지침을 재생산하도록 유도하는 프롬프트 인젝션 (예: 모든 발신 응답에 전체 이메일 본문의 문자 그대로의 인용문을 추가). 페이로드를 출력에 복사하면 해당 이메일/파일/주석을 읽는 다운스트림 에이전트로 전파될 수 있습니다 — 이메일 및 캘린더와 같은 커넥터를 통한 웜 복제 기본 요소입니다.
제품 패치는 없습니다; OpenAI는 모델을 강화하기 위해 GPT-Red를 사용하고 있습니다. 엔터프라이즈 완화: 신뢰할 수 없는 데이터를 지침과 분리 (시스템 프롬프트 격리), 도구 호출별 독립 권한 부여, 아웃바운드 콘텐츠 필터링, 수집된 콘텐츠의 인용문을 포함하는 에이전트 출력을 잠재적 전파 신호로 취급하십시오.
OpenAI Alignment - Self-replicating prompt injections existShattered.io analysis of OpenAI disclosureCryptoBriefing coverage
라이브 피드에서 보기 AI 보안 및 거버넌스 관련 소식을 더 살펴보세요 — 매일 아침 업데이트.
피드 열기 →