OpenAI, 자가 복제 프롬프트 주입의 존재 확인
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- OpenAI는 자체 복제 프롬프트 주입이 AI 에이전트 간에 웜처럼 퍼질 수 있음을 확인했으며 GPT-Red를 사용한 내부 테스트에서 발견되었습니다.
- 회사의 내부 연구에서는 에이전트 간에 자율적으로 확산될 수 있는 AI 웜이 발견되었습니다.
- OpenAI는 보안 연구원들이 수년 동안 두려워했던 것을 공식적으로 확인했습니다.
본문
OpenAI는 자체 복제 프롬프트 주입이 AI 에이전트 간에 웜처럼 퍼질 수 있음을 확인했으며 GPT-Red를 사용한 내부 테스트에서 발견되었습니다. 회사의 내부 연구에서는 에이전트 간에 자율적으로 확산될 수 있는 AI 웜이 발견되었습니다. 아직 실제 공격은 기록되지 않았습니다. OpenAI는 보안 연구원들이 수년 동안 두려워했던 것을 공식적으로 확인했습니다. 즉, 프롬프트 주입은 스스로 복제하고 디지털 웜처럼 AI 에이전트 간에 퍼질 수 있다는 것입니다. 회사는 2026년 9월 25일에 내부 연구팀이 훈련 환경에서 이 기능을 발견했다고 발표했으며, 이는 주요 AI 연구소가 자체 모델에서 자가 복제 프롬프트 주입 취약점을 공개적으로 인정한 최초의 사례입니다. 이 발견은 공개되기 약 3개월 전인 2026년 6월 27일에 처음 이루어졌습니다.
OpenAI 프레임워크에서 "자기 복제" 자격을 얻기 위한 즉각적인 주입을 위해서는 두 가지 작업을 수행해야 합니다. 둘째, AI가 다음에 생성하는 모든 항목에 악의적인 명령의 복사본을 포함하여 모델의 출력 채널을 통해 자신을 재현해야 합니다. 이메일이 그 중 하나입니다. 주입된 프롬프트는 AI 에이전트에게 발신 메시지에 주입을 포함하도록 지시하여 해당 메시지를 다운스트림으로 처리하는 모든 AI 에이전트를 감염시킬 수 있습니다. 주입은 가짜 사고 연쇄 추론을 사용하여 본질적으로 적대적인 지시를 가리는 그럴듯해 보이는 "사고" 단계를 생성할 수 있습니다. 2025년에 시연된 Morris II 웜은 자가 복제 프롬프트 주입이 여러 대규모 언어 모델에 영향을 미칠 수 있음을 보여주었습니다.
초기 인터넷의 약 10%를 마비시킨 악명 높은 1988년 Morris Worm의 이름을 딴 이 연구는 다양한 AI 아키텍처에서 공격 벡터의 이론적 실행 가능성을 입증했습니다. OpenAI는 업계 전반에 걸쳐 AI 보안 조치를 개선하기 위한 광범위한 노력의 일환으로 공개를 구성했습니다. 자가 복제 프롬프트 주입의 확인은 AI 시스템의 강력한 방어가 필요한 긴급한 보안 문제를 강조합니다. OpenAI가 자가 복제 프롬프트 주입의 존재를 확인하는 게시물이 Crypto Briefing에 처음 등장했습니다.