LIVE MARKET
MARKET시세 연결 중
← 실시간 뉴스로

AI 에이전트 성능 8.3%p 개선…선택적 기억 개입 연구

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 장기 작업 중 핵심 정보를 잊는 문제를 줄이기 위해 필요한 순간에만 기억을 주입하는 별도 메모리 에이전트가 제시됐다.
  • Claude Sonnet 4.5 실험에서 Terminal-Bench 2.0 통과율은 37.6%에서 45.9%로 높아졌다.
  • 장기 작업을 수행하는 인공지능(AI) 에이전트의 Terminal-Bench 2.0 성능이 필요한 순간에만 기억을 주입하는 구조를 적용한 실험에서 8.3%포인트 개선됐다.
시장 반응 긍정
ARTICLE BRIEF

본문

장기 작업 중 핵심 정보를 잊는 문제를 줄이기 위해 필요한 순간에만 기억을 주입하는 별도 메모리 에이전트가 제시됐다. Claude Sonnet 4.5 실험에서 Terminal-Bench 2.0 통과율은 37.6%에서 45.9%로 높아졌다. 장기 작업을 수행하는 인공지능(AI) 에이전트의 Terminal-Bench 2.0 성능이 필요한 순간에만 기억을 주입하는 구조를 적용한 실험에서 8.3%포인트 개선됐다. 별도 메모리 에이전트가 작업 중 핵심 정보를 관리하다가 행동 에이전트가 경로를 이탈하거나 실수를 반복할 가능성이 있을 때만 개입하는 방식이다. 논문 ‘Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents’는 행동 에이전트와 별도로 작동하는 메모리 에이전트를 제안했다.

Claude Sonnet 4.5를 행동 에이전트로 사용한 실험에서 Terminal-Bench 2.0 pass@1은 37.6%에서 45.9%로 8.3%포인트 상승했다.

연구진이 제시한 성능 수치는 이들 두 벤치마크 실험에 한정된다. 연구진은 전체 메모리를 매번 노출하거나 모든 단계에서 알림을 보내는 방식보다 선택적 개입이 효과적이었다고 밝혔다. 기존 AI 에이전트의 메모리 방식은 정보를 저장하거나 사용자의 요청에 따라 검색하는 데 집중하는 경우가 많았다. 장기 실행형 AI 에이전트가 이메일 발송, 일정 관리, 여행 예약처럼 여러 단계를 거치는 작업으로 확장되는 가운데 나온 연구라는 점도 눈에 띈다. 메타(Meta)는 9월 8일 개인형 AI 에이전트 Muse를 공개했다. AI 에이전트의 장기 기억을 검증하고 관리하는 연구는 앞서 마이크로소프트가 AI 기억 검증 후 통과율을 39%에서 73%로 높였다고 소개한 사례 에서도 제시됐다.