LIVE MARKET
MARKET시세 연결 중
바로가기
← 실시간 뉴스로

엔비디아, 터미널 에이전트 성공률 50%→68.03%

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식을 공개했다.
  • TerminalBench-Lite에서 후보 8개를 생성하고 GPT-5.6 Sol이 검증한 조건의 Pass@1은 50.00%에서 68.03%로 높아졌다.
  • 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식으로 벤치마크 성공률을 높였다.
시장 반응 긍정SOLNVDA
ARTICLE BRIEF

본문

엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식을 공개했다. TerminalBench-Lite에서 후보 8개를 생성하고 GPT-5.6 Sol이 검증한 조건의 Pass@1은 50.00%에서 68.03%로 높아졌다. 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식으로 벤치마크 성공률을 높였다. TerminalBench-Lite 실험에서 Pass@1은 기본 에이전트의 50.00%에서 68.03%로 상승했다. 엔비디아 연구진이 공개한 ‘Mid-Harness’는 에이전트가 작업 단계마다 여러 명령 후보를 만들면 검증 모델이 평가한 뒤 하나를 실행하는 구조다. 엔비디아 는 연구 페이지에서 잘못된 명령이 실행되면 이후 작업 환경에도 영향을 줄 수 있어 실행 전 검증 단계를 두었다고 설명했다. 실험에서는 TMAX-9B가 명령 후보를 생성하고 GPT-5.6 Sol이 검증을 맡았다.

단계마다 후보 8개를 생성한 조건에서 Pass@1이 50.00%에서 68.03%로 높아졌다.

연구진은 후보 수를 늘리는 것만으로 성능 향상을 기대하기 어렵다고 밝혔다. 검증 능력이 약하면 후보를 추가해도 이점을 살리기 힘들며, 유효한 행동을 골라내는 검증기가 중요하다는 설명이다. 엔비디아 연구 페이지는 TMAX-9B와 TerminalBench-Lite 조합에서 두 방식을 함께 쓴 경우 궤적만 늘린 경우보다 성공률이 높고 추정 토큰 비용은 낮았다고 밝혔다. 다만 공개된 수치는 정해진 벤치마크 실험 결과로, 실제 터미널 작업이나 긴 작업 흐름에서 같은 효과가 나타나는지는 확인되지 않았다.