Nvidia 보고서에 따르면 AI 모델은 대규모 작업에서 정확도가 떨어지고 규모가 급격히 감소합니다.
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- Nvidia 연구에 따르면 AI 모델 정확도는 장기 작업에서 62.8% 감소했으며, 항목 ID 누락으로 인해 최대 64.3%까지 떨어졌습니다.
- 새로운 Nvidia 벤치마크에서는 컨텍스트가 커짐에 따라 개방형 모델이 흔들리고 항목 레이블이 누락되어 상황이 더욱 악화되는 것을 보여줍니다.
- AI 에이전트는 점점 더 긴 다단계 작업을 처리하도록 요청받습니다.
본문
Nvidia 연구에 따르면 AI 모델 정확도는 장기 작업에서 62.8% 감소했으며, 항목 ID 누락으로 인해 최대 64.3%까지 떨어졌습니다. 새로운 Nvidia 벤치마크에서는 컨텍스트가 커짐에 따라 개방형 모델이 흔들리고 항목 레이블이 누락되어 상황이 더욱 악화되는 것을 보여줍니다. AI 에이전트는 점점 더 긴 다단계 작업을 처리하도록 요청받습니다. 2026년 9월 30일에 발표된 논문에서 Nvidia 연구원들은 컨텍스트 길이가 확장됨에 따라 평균 모델 정확도가 62.8% 감소한다는 사실을 발견했습니다. 이 논문의 제목은 "Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability"이며 arXiv:2609.38712로 등록되어 있습니다. 테스트는 입력이 4,000개 토큰에서 128,000개 토큰으로 늘어남에 따라 모델이 이를 올바르게 계속 수행할 수 있는지 여부였습니다.
이 논문의 핵심 주장은 짧은 작업을 잘 수행한다고 해서 프로덕션 규모의 워크플로에서 신뢰할 수 있는 결과가 보장되지는 않는다는 것입니다. Nvidia 연구는 2025년과 2026년에 걸쳐 학술 및 산업 환경 전반에 걸쳐 대규모 언어 모델 및 에이전트의 장기적인 한계를 반복적으로 문서화한 점점 더 많은 연구에 추가됩니다. 이 문서의 기여는 유일한 실제 변수가 궤도에 머물도록 충분히 간단한 작업을 통해 오류를 명확하게 격리하는 것입니다. 긴 작업을 더 작은 하위 작업으로 나누고 구조화된 식별자로 각 항목에 레이블을 지정합니다. AI 산업의 대부분을 하드웨어로 구동하는 Nvidia가 자체 Nemotron Super가 0.138로 떨어지는 결과를 발표한 것도 주목할 만합니다. 시간이 오래 걸리는 작업에 대한 AI 모델의 정확도 감소는 AI 워크플로우에서 향상된 작업 세분화 및 구조화된 데이터 라벨링의 필요성을 강조합니다.
Nvidia의 포스트 논문에서는 AI 모델이 장기간 작업에서 정확성을 잃고 규모가 급격히 감소하는 현상이 Crypto Briefing에서 처음으로 나타났음을 발견했습니다.