LIVE MARKET
MARKET시세 연결 중
바로가기
← 실시간 뉴스로

Nvidia 연구진은 판단 모델을 통해 AI 에이전트 신뢰성을 향상시켰습니다.

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • Nvidia의 Mid-Harness를 사용하면 심사위원 모델이 터미널 AI 에이전트를 위한 최선의 조치를 선택할 수 있어 TerminalBench-Lite에서 Pass@1이 50.00%에서 68.03%로 향상됩니다.
  • Mid-Harness라는 새로운 방법은 터미널 에이전트가 무엇이든 실행하기 전에 검증 모델이 최상의 명령을 선택하도록 합니다.
  • Nvidia 연구원들은 신뢰할 수 없는 AI 에이전트에 대한 상당히 인간적인 수정 방법을 발견했습니다.
시장 반응 중립NVDA
ARTICLE BRIEF

본문

Nvidia의 Mid-Harness를 사용하면 심사위원 모델이 터미널 AI 에이전트를 위한 최선의 조치를 선택할 수 있어 TerminalBench-Lite에서 Pass@1이 50.00%에서 68.03%로 향상됩니다. Mid-Harness라는 새로운 방법은 터미널 에이전트가 무엇이든 실행하기 전에 검증 모델이 최상의 명령을 선택하도록 합니다. Nvidia 연구원들은 신뢰할 수 없는 AI 에이전트에 대한 상당히 인간적인 수정 방법을 발견했습니다. 입력하기 전에 생각하십시오. Mid-Harness라고 불리는 새로운 방법은 에이전트가 여러 가지 가능한 작업을 생성한 다음 별도의 판단 모델이 실제로 실행되는 작업을 선택하도록 합니다. 한 벤치마크에서는 추가로 고민한 결과 첫 번째 시도 성공률이 50.00%에서 68.03%로 높아졌습니다. 하나의 잘못된 명령이 전체 작업을 싱크할 수 있는 명령줄 내부에서 작동하는 소프트웨어의 경우 이것이 중요합니다.

또한 연구원들은 추가 컴퓨팅 비용을 지출하기 위한 두 가지 전략을 비교했습니다. 이 논문은 Nvidia의 강민기(Minki Kang)와 Ehsan Hosseini-Asl을 포함한 저자들이 2026년 12월 16일에 출판했습니다. 2026년 초 Nvidia는 에이전트 기술의 실제 런타임 영향을 측정하기 위해 2026년 8월경에 게시된 프레임워크인 ACES를 도입했습니다. 2026년 9월에는 Open Agent Safety Platform이 출시되었습니다. 68.03%의 Pass@1 비율은 실질적인 개선이지만 여전히 첫 번째 시도에서 3번 중 1번의 작업이 실패한다는 의미입니다. Nvidia의 Mid-Harness 방법은 AI 신뢰성을 향상시켜 잠재적으로 비용을 절감하고 명령줄 환경의 효율성을 향상시킵니다. Nvidia 연구진은 Crypto Briefing에 처음 등장한 판단 모델을 통해 AI 에이전트 신뢰성을 향상시켰습니다.