LIVE MARKET
MARKET시세 연결 중
바로가기
← 실시간 뉴스로

벤치마크 10종서 결함 219개…AI 에이전트 점수 검증 과제

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • UC버클리 연구진이 AI 에이전트 벤치마크 10종을 감사해 219개 결함을 확인했다.
  • 연구 결과와 앤스로픽의 예측시장 가격 변동 사이의 인과관계는 확인되지 않았다.
  • 이 결과는 점수만으로 모델의 실제 과제 수행 능력을 판단하기 어렵다는 점을 보여준다.
시장 반응 중립
ARTICLE BRIEF

본문

UC버클리 연구진이 AI 에이전트 벤치마크 10종을 감사해 219개 결함을 확인했다. 연구 결과와 앤스로픽의 예측시장 가격 변동 사이의 인과관계는 확인되지 않았다. 이 결과는 점수만으로 모델의 실제 과제 수행 능력을 판단하기 어렵다는 점을 보여준다. 연구진은 2026년 5월 12일 공개한 논문에서 감사 도구 ‘벤치잭(BenchJack)’을 이용해 과제를 풀지 않고도 높은 점수를 얻는 취약점을 찾았다고 밝혔다. 10종 가운데 9종에서는 실제 과제를 수행하지 않고도 거의 만점에 가까운 점수를 내는 공격을 구현했다. 연구진은 웹 탐색 평가인 WebArena와 데스크톱 작업 평가인 OSWorld를 세 차례 수정해 악용 가능한 과제를 없앴다고 보고했다. 결함은 에이전트와 평가 시스템의 격리 실패, 정답 정보 노출, 채점 로직의 허점 등에서 발생했다.

다만 평가 환경과 채점 방식에 결함이 있으면 점수가 실제 능력을 제대로 반영하지 못할 수 있어, 벤치마크 순위나 점수만으로 모델의 실전 능력을 단정하기 어렵다.

앤스로픽의 ‘10월 말 최고 AI 모델’ 예측시장 가격은 연구 결과와 별도로 봐야 한다. 폴리마켓 계약 페이지는 10월 3일 낮 12시 45분(한국시간) 기준 구글 64%, 앤스로픽 37%를 표시했다. 이번 연구는 벤치마크 평가 과정의 신뢰성을 점검할 필요성을 제기했지만, 앤스로픽 모델의 경쟁력을 판정하는 자료는 아니다. 논문 원문 연구진은 웹 탐색 평가인 WebArena와 데스크톱 작업 평가인 OSWorld를 세 차례 수정해 악용 가능한 과제를 없앴다고 보고했다.