워터마크 적용 뒤 AI 모델 유해 응답·도구 호출 달라져
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- LLM 워터마크가 일부 오픈 웨이트 모델의 유해 요청 거부와 AI 에이전트 도구 호출에 영향을 줄 수 있다는 연구 결과가 나왔다.
- LLM에 AI 워터마크를 적용하면 일반적인 문장 선택뿐 아니라 유해 요청 거부와 AI 에이전트의 도구 호출까지 달라질 수 있다는 연구 결과가 나왔다.
- 일부 오픈 웨이트 모델에서는 워터마크 적용 뒤 유해 요청에 응답할 가능성이 높아졌다.
본문
LLM 워터마크가 일부 오픈 웨이트 모델의 유해 요청 거부와 AI 에이전트 도구 호출에 영향을 줄 수 있다는 연구 결과가 나왔다. LLM에 AI 워터마크를 적용하면 일반적인 문장 선택뿐 아니라 유해 요청 거부와 AI 에이전트의 도구 호출까지 달라질 수 있다는 연구 결과가 나왔다. 일부 오픈 웨이트 모델에서는 워터마크 적용 뒤 유해 요청에 응답할 가능성이 높아졌다. 같은 모델과 프롬프트를 사용하고 워터마크 적용 여부만 바꾼 실험이다. 그러나 AI 에이전트가 JSON 형식으로 도구명과 인자값을 생성하는 환경에서는 도구 선택뿐 아니라 경로·수신자·검색어·금액 같은 인자도 달라질 수 있다. Lasso Security는 도구 호출 평가에 BFCL v4 단일 턴 AST를 사용했다. 워터마크 적용 뒤 도구 호출 정확도는 7개 모델 가운데 6개에서 낮아졌고, 4개 모델에서는 감소 폭이 통계적으로 유의미했다.
워터마크 적용 전후 호출 결과가 달라진 비율은 21개 모델·온도 조합에서 평균 6.5%였다.
유해 요청 거부 실험에는 HarmBench의 유해 행동 200개와 JailbreakBench의 정상 요청 100개가 사용됐다. 프롬프트 인젝션과 도구 호출을 함께 통제해야 한다는 점은 기업용 AI 보안 통제 체계가 모델 응답과 외부 도구 권한을 함께 다뤄야 한다는 지적 과도 맞닿아 있다. 유럽연합 AI Act 제50조 2항은 합성 텍스트·이미지·음성·영상 생성 시스템 제공자가 결과물을 기계 판독 가능한 방식으로 표시하고 AI 생성물임을 탐지할 수 있도록 요구한다. 모델·키·프롬프트 조건에 따라 행동 변화가 나타날 수 있다는 점을 확인했으며, 실제 운영 중인 에이전트가 유해 도구를 실행하는 피해까지 입증한 연구도 아니다.