LIVE MARKET
MARKET시세 연결 중
← 실시간 뉴스로

오픈AI, AI 에이전트 자기복제형 공격 확인

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • AI 에이전트가 이메일·파일·코드에 악성 지시를 다시 삽입해 다른 에이전트로 전달할 수 있는 현상이 실험 환경에서 관찰됐다.
  • 오픈AI가 인공지능(AI) 에이전트가 악성 프롬프트를 이메일·파일·코드에 다시 삽입해 다른 에이전트로 전파하는 '자기복제형 프롬프트 인젝션'을 실험 환경에서 확인했다.
  • 오픈AI는 9월 25일 공개한 공식 보고서에서 GPT-Red 방식의 내부 모델을 활용해 해당 공격 유형을 발견했다고 밝혔다.
시장 반응 중립
ARTICLE BRIEF

본문

AI 에이전트가 이메일·파일·코드에 악성 지시를 다시 삽입해 다른 에이전트로 전달할 수 있는 현상이 실험 환경에서 관찰됐다. 오픈AI가 인공지능(AI) 에이전트가 악성 프롬프트를 이메일·파일·코드에 다시 삽입해 다른 에이전트로 전파하는 '자기복제형 프롬프트 인젝션'을 실험 환경에서 확인했다. 오픈AI는 9월 25일 공개한 공식 보고서에서 GPT-Red 방식의 내부 모델을 활용해 해당 공격 유형을 발견했다고 밝혔다. 최초 발견일은 6월 27일이며, 실험은 평가용으로 시뮬레이션한 도구 호출 환경에서 진행됐다. 자기복제형 공격은 모델이 답장·파일·코드 같은 결과물에 같은 지시를 다시 넣도록 유도한다는 점에서 한 단계 확장된 형태다. AI 에이전트는 답장 마지막에 원문 이메일 전체를 반복해 삽입했고, 이후 해당 답장을 읽는 다른 에이전트가 같은 지시에 노출될 수 있는 구조가 형성됐다.

파일시스템과 코드 주석을 통해 공격 지시가 복제되는 사례도 발견됐으며, 이메일·캘린더 같은 외부 연결 기능을 사용하는 환경을 중심으로 가능성이 시험됐다. 공격 방식에는 가짜 사고 과정이나 가짜 도구 메시지로 모델을 속이는 방법도 포함됐다. 연구진은 2024년 논문 'Here Comes the AI Worm'에서 생성형 AI 이메일 보조 시스템 사이에 악성 프롬프트가 연쇄적으로 전달되는 'Morris II'를 제시했다. Morris II 연구는 이메일 보조 AI가 악성 지시를 답변에 삽입하고 이를 다른 AI 시스템으로 확산시킬 수 있는지 실험했다. 오픈AI는 자기복제형 공격을 GPT-Red의 훈련 목표에 포함해 방어력을 높일 계획이다. AI 에이전트 확산에 따라 기업들이 권한·감사 통제 체계를 구축하고 있다는 본지 보도 도 같은 변화에 초점을 맞췄다.