Apa yang terjadi
Pada 2026-09-25 tim Alignment OpenAI menerbitkan 'Self-replicating prompt injections exist' (penemuan 2026-06-27) menunjukkan melalui kerangka self-play GPT-Red bahwa prompt injections dapat menyebar sendiri seperti worm komputer: melalui replay email, penulisan filesystem, dan komentar kode, menggunakan gaya chain-of-thought palsu dan pesan alat palsu plus rantai multi-hop. OpenAI menyatakan tidak ada dampak yang terjadi di luar lingkungan simulasi dan merilis temuan karena sifat baru dari serangan tersebut, bukan insiden.
Mengapa penting
Ini adalah lab AI besar pertama yang secara publik mengakui worm-class self-replicating prompt injection dalam modelnya sendiri — kelas serangan eksekusi agen baru dengan mekanisme yang dapat direproduksi dan didemonstrasikan. Ini memvalidasi bahwa konektor agen (email/kalender/file/repo-kode) adalah saluran yang dapat menyebar sendiri, arsitektur yang persis digunakan perusahaan saat ini. Pembela harus memperlakukan semua konteks yang dicerna (email, file, komentar, ringkasan) sebagai instruksi tidak tepercaya dan menegakkan penanganan instruksi terpisah di lapisan harness/kepercayaan.
Vektor serangan
Prompt injection yang baik mencapai tujuan permusuhan dan menginduksi agen untuk mereproduksi instruksi yang disuntikkan pada saluran output publik/dapat dibagikan (misalnya menambahkan kutipan literal seluruh isi email ke setiap balasan keluar). Menyalin muatan ke output memungkinkannya menyebar ke agen hilir mana pun yang membaca email/file/komentar tersebut — primitif replikasi worm melalui konektor seperti email dan kalender.
Mitigasi
Tidak ada tambalan produk; OpenAI menggunakan GPT-Red untuk memperkuat model. Mitigasi perusahaan: jaga data tidak tepercaya terpisah dari instruksi (isolasi system-prompt), otorisasi independen per panggilan alat, pemfilteran konten keluar, dan perlakukan output agen apa pun yang menyematkan kutipan konten yang dicerna sebagai sinyal propagasi potensial.