LIVE MARKET
MARKET시세 연결 중
바로가기
← 실시간 뉴스로

메타 연구진, AI 에이전트 점수 최대 34.8% 높여…토큰 사용도 늘어

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 메타·듀크대학교·캘리포니아대학교 데이비스캠퍼스 연구진이 모델을 재학습하지 않고 실행 환경을 여러 경로로 개선했다.
  • 수학 추론 성능은 기존 방식보다 34.8% 높았지만 토큰 사용량도 늘었다.
  • AI 에이전트의 실행 환경을 여러 갈래로 개선한 연구에서 수학·코딩 벤치마크 점수가 기존 방식보다 높게 나왔다.
시장 반응 긍정META
ARTICLE BRIEF

본문

메타·듀크대학교·캘리포니아대학교 데이비스캠퍼스 연구진이 모델을 재학습하지 않고 실행 환경을 여러 경로로 개선했다. 수학 추론 성능은 기존 방식보다 34.8% 높았지만 토큰 사용량도 늘었다. AI 에이전트의 실행 환경을 여러 갈래로 개선한 연구에서 수학·코딩 벤치마크 점수가 기존 방식보다 높게 나왔다. 올림피아드 수준 수학 추론 정확도는 62.0%로, 비교 대상인 Meta-Harness의 46.0%보다 높았지만 과제 해결에 쓴 토큰도 늘었다. 메타(Meta), 듀크대학교(Duke University), 캘리포니아대학교 데이비스캠퍼스(University of California, Davis) 연구진은 9월 29일 논문 저장소 arXiv에 ‘에이전트 하네스 최적화를 위한 자기개선 브랜치 혼합(Mixture of Self-Improving Branches for Agent Harness Optimization)’을 공개했다.

기존 Meta-Harness는 후보 하네스를 만들고 개발 데이터에서 실행한 뒤, 결과와 탐색 기록을 바탕으로 다음 후보를 제안한다. 올림피아드 수준 수학 추론에서 새 시스템의 정확도는 62.0%, Meta-Harness는 46.0%였다. Terminal-Bench 2.0에서는 상대 개선율 11.6%, SWE-bench Lite에서는 3.8%를 기록했다. 논문 부록의 토큰 집계에서 브랜치 두 개를 쓴 시스템은 Meta-Harness보다 수학 실험에서 1.21배, Terminal-Bench 2.0에서 1.71배, SWE-bench Lite에서 1.50배 많은 토큰을 사용했다. 따라서 점수 상승만으로 비용 효율까지 개선됐다고 볼 수는 없다. 논문은 수학 추론의 다른 설정과 SWE-bench Lite에서 라우터 결과가 더 강한 단일 브랜치보다 각각 테스트 사례 한 건 적었다고 밝혔다.

연구진은 브랜치별 강점을 결합할 가능성을 제시했지만, 라우팅이 개별 하네스보다 늘 우수하다는 결과는 아니다.