LIVE MARKET
MARKET시세 연결 중
← 실시간 뉴스로

LLM 요청 61억건 공개…캐시·라우팅 연구 활용

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • Chutes와 하버드 연구진이 1년간 수집한 대규모 언어 모델 요청 61억2241만3756건의 메타데이터를 공개했다.
  • 반복 요청과 모델별 이용 변화가 AI 추론 인프라 연구 자료로 제시됐다.
  • Chutes와 하버드 연구진이 대규모 언어 모델(LLM) 요청 61억2241만3756건을 담은 공개 데이터셋을 내놨다.
시장 반응 중립
ARTICLE BRIEF

본문

Chutes와 하버드 연구진이 1년간 수집한 대규모 언어 모델 요청 61억2241만3756건의 메타데이터를 공개했다. 반복 요청과 모델별 이용 변화가 AI 추론 인프라 연구 자료로 제시됐다. Chutes와 하버드 연구진이 대규모 언어 모델(LLM) 요청 61억2241만3756건을 담은 공개 데이터셋을 내놨다. 실제 대화 내용이 아닌 서빙 메타데이터를 공개해 생성형 AI 인프라의 캐시와 라우팅 구조를 분석할 수 있도록 한 자료다. 연구 논문 ‘A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing’은 2025년 4월 11일부터 2026년 4월 12일까지 Chutes에서 발생한 요청을 분석했다. 데이터에는 9174개 모델과 익명화된 사용자 31만4970명의 요청 기록이 포함됐다.

공개 저장소에는 요청 시각, 모델·사용자·서빙 인스턴스 식별자, 입력·출력 토큰 수, 첫 토큰 생성 시간(TTFT), 캐시된 토큰 수가 담겼다.

동일 사용자가 같은 모델에 다시 보낸 요청의 99%가 이전 요청 후 15분 안에 발생했다. 분산형 추론 플랫폼은 여러 인스턴스에 요청을 나눠 처리하며, 이번 자료는 실제 운영 환경에서 축적한 요청 흐름을 연구 대상으로 삼았다. 캐시 재사용률과 GPU 부하 분산 사이의 관계를 실제 요청 기록으로 분석할 수 있다는 점이 핵심이다. 프롬프트와 모델 응답은 포함되지 않았고 요청 시간, 토큰 수, 지연시간, 캐시 관련 정보 등 서빙 메타데이터만 공개됐습니다. 동일 사용자가 같은 모델에 반복 요청한 경우, 그 요청의 99%가 이전 요청 후 15분 안에 발생했다는 연구 결과입니다.