Chutes AI와 Harvard는 61억 2천만 개의 LLM 요청에 대한 공개 데이터 세트를 공개합니다.
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- Chutes AI와 Harvard는 1년 동안 61억 2천만 개의 LLM 요청에 대한 공개 데이터 세트를 공개하여 99%의 반복률과 작업 부하 이동을 보여줍니다.
- 9,174개 모델에 걸친 1년 동안의 데이터 세트는 요청의 99%가 15분 이내에 반복된다는 사실을 보여 주며, 이는 AI 인프라가 구축되는 방식에 중요한 영향을 미치는 결과입니다.
- 수십억 개의 AI 요청이 내부적으로 실제로 어떤 모습일지 궁금했다면 이제 알아볼 수 있습니다.
본문
Chutes AI와 Harvard는 1년 동안 61억 2천만 개의 LLM 요청에 대한 공개 데이터 세트를 공개하여 99%의 반복률과 작업 부하 이동을 보여줍니다. 9,174개 모델에 걸친 1년 동안의 데이터 세트는 요청의 99%가 15분 이내에 반복된다는 사실을 보여 주며, 이는 AI 인프라가 구축되는 방식에 중요한 영향을 미치는 결과입니다. 수십억 개의 AI 요청이 내부적으로 실제로 어떤 모습일지 궁금했다면 이제 알아볼 수 있습니다. Bittensor의 Subnet 64에서 실행되는 분산형 AI 추론 플랫폼인 Chutes는 하버드 대학교 연구원들과 협력하여 지금까지 수집된 LLM 제공 메타데이터의 최대 공개 데이터 세트를 공개했습니다. 그 숫자는 엄청납니다. 9,174개 모델에 걸쳐 6,122,413,756건의 요청이 생성되었으며, 이는 1년 동안의 프로덕션 트래픽 동안 314,970명의 익명화된 사용자에 의해 생성되었습니다.
데이터 세트는 2025년 4월 11일부터 2026년 4월 12일까지이며 이제 GitHub 및 Harvard S3 버킷을 통해 무료로 사용할 수 있습니다. 1년 동안 Chutes는 대략 35.8조 개의 입력 토큰과 2.52조 개의 출력 토큰을 처리했습니다. Harvard, Chicago University 및 Chutes의 연구원들이 공동으로 작성한 첨부 문서는 데이터를 학술 작업에 실제로 사용할 수 있도록 하는 일종의 상세한 방법론 노트를 제공합니다. 아마도 이 데이터 세트에 묻혀 있는 가장 중요한 결과는 반복 요청의 99%가 15분 내에 발생한다는 것입니다. Chutes는 분산 GPU 인프라에서 오픈 소스 LLM을 실행하는 Bittensor의 분산 네트워크, 특히 Subnet 64의 일부로 작동합니다.
Chutes와 Harvard 간의 협력에는 2026년 3월부터 7월까지의 사전 동의 기간이 포함되어 있으며, 연구원들은 데이터 세트에 사용 데이터를 제공하는 대가로 25% 할인을 받았습니다. 데이터 세트의 출시는 사용자 행동에 대한 통찰력을 제공하고 AI 모델 효율성과 인프라를 최적화하여 AI 연구를 크게 발전시킬 수 있습니다. Chutes AI와 Harvard가 61억 2천만 건의 LLM 요청에 대한 공개 데이터 세트를 공개한 이후 Crypto Briefing에 처음 등장했습니다.