엔비디아, 터미널 에이전트 성공률 50%→68.03%
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식을 공개했다.
- TerminalBench-Lite에서 후보 8개를 생성하고 GPT-5.6 Sol이 검증한 조건의 Pass@1은 50.00%에서 68.03%로 높아졌다.
- 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식으로 벤치마크 성공률을 높였다.
본문
엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식을 공개했다. TerminalBench-Lite에서 후보 8개를 생성하고 GPT-5.6 Sol이 검증한 조건의 Pass@1은 50.00%에서 68.03%로 높아졌다. 엔비디아 연구진이 터미널 에이전트의 명령 후보를 실행 전에 검증하는 방식으로 벤치마크 성공률을 높였다. TerminalBench-Lite 실험에서 Pass@1은 기본 에이전트의 50.00%에서 68.03%로 상승했다. 엔비디아 연구진이 공개한 ‘Mid-Harness’는 에이전트가 작업 단계마다 여러 명령 후보를 만들면 검증 모델이 평가한 뒤 하나를 실행하는 구조다. 엔비디아 는 연구 페이지에서 잘못된 명령이 실행되면 이후 작업 환경에도 영향을 줄 수 있어 실행 전 검증 단계를 두었다고 설명했다. 실험에서는 TMAX-9B가 명령 후보를 생성하고 GPT-5.6 Sol이 검증을 맡았다.
단계마다 후보 8개를 생성한 조건에서 Pass@1이 50.00%에서 68.03%로 높아졌다.
연구진은 후보 수를 늘리는 것만으로 성능 향상을 기대하기 어렵다고 밝혔다. 검증 능력이 약하면 후보를 추가해도 이점을 살리기 힘들며, 유효한 행동을 골라내는 검증기가 중요하다는 설명이다. 엔비디아 연구 페이지는 TMAX-9B와 TerminalBench-Lite 조합에서 두 방식을 함께 쓴 경우 궤적만 늘린 경우보다 성공률이 높고 추정 토큰 비용은 낮았다고 밝혔다. 다만 공개된 수치는 정해진 벤치마크 실험 결과로, 실제 터미널 작업이나 긴 작업 흐름에서 같은 효과가 나타나는지는 확인되지 않았다.