LIVE MARKET
MARKET시세 연결 중
바로가기
← 실시간 뉴스로

문맥 4K→128K 늘리자 오픈 모델 평균 성능 62.8% 하락…엔비디아 연구

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 엔비디아 연구진이 7개 오픈 웨이트 모델을 평가한 결과, 문맥을 4K에서 128K로 늘렸을 때 평균 성능이 62.8% 낮아졌다.
  • AI 모델의 평균 성능이 입력 문맥을 4K에서 128K로 늘렸을 때 7개 오픈 웨이트 모델 평가에서 62.8% 낮아졌다.
  • 긴 문맥을 받아들이는 능력만으로 여러 단계의 작업을 정확히 이어가는 능력을 판단하기 어렵다는 연구 결과다.
시장 반응 부정NVDA
ARTICLE BRIEF

본문

엔비디아 연구진이 7개 오픈 웨이트 모델을 평가한 결과, 문맥을 4K에서 128K로 늘렸을 때 평균 성능이 62.8% 낮아졌다. AI 모델의 평균 성능이 입력 문맥을 4K에서 128K로 늘렸을 때 7개 오픈 웨이트 모델 평가에서 62.8% 낮아졌다. 긴 문맥을 받아들이는 능력만으로 여러 단계의 작업을 정확히 이어가는 능력을 판단하기 어렵다는 연구 결과다. 엔비디아($NVDA) 연구진은 9월 30일 논문 ‘Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability’를 공개하고 장기 작업 평가 방식인 ‘Long-Transduction’을 제안했다고 크립토브리핑은 보도했다. 이 벤치마크는 산술 계산, UUID 정렬, 변수 조회, 표 변환처럼 모델이 입력을 계속 참조하며 결과를 이어 내야 하는 작업을 다룬다.

연구진은 문맥 길이와 입력 데이터 형식, 단계별 작업 복잡도를 각각 바꿔 성능 변화를 측정했다.

입력 형식을 바꿨을 때 평균 성능은 36.5% 낮아졌고, 단계별 작업 복잡도를 높였을 때는 39.9% 감소했다. 입력 항목의 안정적인 식별자를 제거했을 때도 작업별로 성능이 떨어졌다. Long-Transduction은 모델이 긴 생성 과정에서 입력을 읽고 상태를 바꾸며 결과를 이어 쓰는 능력을 살펴보도록 설계됐다. 따라서 짧은 문답이나 단일 작업 점수만으로 여러 단계가 이어지는 업무의 안정성을 판단하기 어렵다는 것이 연구진의 문제의식이다. 실제 기업 업무나 모든 AI 서비스에서 같은 폭의 성능 저하가 나타난다는 의미는 아니다. 연구 결과만으로 실제 업무 시스템의 정확도나 도입 효과를 판단할 수는 없다.