LIVE MARKET
MARKET시세 연결 중
← 실시간 뉴스로

세일즈포스 AI 에이전트 성공률 43.5%→93.0%

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 세일즈포스 연구진이 모델 가중치를 고정한 채 AI 에이전트 실행 구조를 개선해 WebArena-Infinity 성공률을 43.5%에서 93.0%로 높였다.
  • 세일즈포스 AI 에이전트의 웹 작업 성공률이 모델 가중치를 바꾸지 않은 상태에서 43.5%에서 93.0%로 높아졌다.
시장 반응 긍정
ARTICLE BRIEF

본문

세일즈포스 연구진이 모델 가중치를 고정한 채 AI 에이전트 실행 구조를 개선해 WebArena-Infinity 성공률을 43.5%에서 93.0%로 높였다. 세일즈포스 AI 에이전트의 웹 작업 성공률이 모델 가중치를 바꾸지 않은 상태에서 43.5%에서 93.0%로 높아졌다. 세일즈포스(Salesforce, $CRM) AI 리서치와 Agentforce 소속 연구자 12명은 2026년 7월 31일 제출한 논문 ‘DarwinX: Evolving Agent Harnesses Through Natural Selection’에서 이 같은 결과를 제시했다. 논문은 AI 모델 자체를 재학습하지 않고 작업 수행 구조를 개선하는 프레임워크를 설명한다. 하네스는 AI 모델이 프롬프트와 도구, 메모리, 스킬, 제어 흐름을 이용해 실제 작업을 수행하도록 구성한 실행 구조를 뜻한다.

동일한 GPT-5.5 모델을 사용했을 때 기본 하네스의 감사 후 pass@1은 43.5%였지만, DarwinX 적용 하네스는 93.0%를 기록했다.

무효 궤적은 기본 하네스의 293건에서 DarwinX 적용 후 17건으로 줄었고, 평가 영역이나 특권 호스트에 접근하는 유형은 사라졌다고 논문은 밝혔다. Terminal-Bench 2.1에서 GPT-5.5 기준 성능은 75.5%에서 83.2%로 올랐고, GPT-5.6 솔에서는 84.7%를 기록했다. Terminal-Bench 2.1에서 진화한 하네스를 SWE-bench Verified에 수정 없이 적용한 결과는 84.2%였다. 이번 연구는 AI 에이전트의 실행 경험을 지식으로 축적해 성능을 높인 위키스킬 연구 와 함께 모델 파라미터를 직접 바꾸지 않는 성능 개선 흐름을 보여준다. 다만 에이전트포스의 사업 지표가 분기 매출이 아닌 연간반복매출로 제시됐던 사례 처럼 연구 성과와 상업적 성과는 구분해 볼 필요가 있다.

# 세일즈포스 # ai 에이전트 # DarwinX # 생성형 AI # WebArena-Infinity 세일즈포스 AI 에이전트의 웹 작업 성공률이 모델 가중치를 바꾸지 않은 상태에서 43.5%에서 93.0%로 높아졌다.