누군가 56억 개의 TikTok 동영상을 스크랩하여 Hugging Face에 무료로 데이터를 올렸습니다.
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 개발자는 TikTok 약관에서 금지하는 방식으로 앱의 비공개 API를 통해 스크랩한 약 56억 개의 공개 TikTok 동영상에 대한 메타데이터를 게시했습니다.
- 해시함수를 사용하는 개발자는 무료로 다운로드할 수 있는 오픈 소스 AI 저장소 Hugging Face에 약 56억 개의 공개 TikTok 비디오에 대한 메타데이터를 게시했습니다.
- 각 행에는 캡션, 해시태그, 사운드 ID, 화면 텍스트, TikTok Shop 제품 및 판매자 ID가 포함되며 조회수, 좋아요, 댓글, 공유, 저장 및 다운로드 횟수가 포함됩니다.
본문
개발자는 TikTok 약관에서 금지하는 방식으로 앱의 비공개 API를 통해 스크랩한 약 56억 개의 공개 TikTok 동영상에 대한 메타데이터를 게시했습니다. 해시함수를 사용하는 개발자는 무료로 다운로드할 수 있는 오픈 소스 AI 저장소 Hugging Face에 약 56억 개의 공개 TikTok 비디오에 대한 메타데이터를 게시했습니다. 각 행에는 캡션, 해시태그, 사운드 ID, 화면 텍스트, TikTok Shop 제품 및 판매자 ID가 포함되며 조회수, 좋아요, 댓글, 공유, 저장 및 다운로드 횟수가 포함됩니다. 일부 필드는 TikTok의 자체 라벨입니다. 동영상이 AI 생성으로 표시되는지 여부와 TikTok이 해당 동영상을 For You 페이지에서 제외하는지 여부입니다.
수십억 개의 게시물에 대한 캡션, 해시태그, 사운드 ID 및 참여 횟수는 입소문이 나는 항목이나 TikTok Shop에서 판매되는 항목, 클릭하는 단어와 문구와 클릭하지 않는 단어 및 문구를 예측하는 모델과 사람들이 짧은 형식의 비디오에서 글을 쓰는 방법을 학습하는 언어 모델의 원시 자료입니다. 연구 도구는 미국, EEA, 영국, 캐나다, 스위스를 포함한 지역의 학술 기관과 EU의 일부 비영리 기관의 자격을 갖춘 연구원에게 열려 있으며 신청과 승인이 필요합니다. 이 시스템은 3주 만에 32억 3천만 개의 제작자 프로필, 59억 4천만 개의 동영상, 28억 개의 댓글을 수집했다고 합니다. 라이센스는 CC BY-NC 4.0이며 카드에는 연구 및 개인 용도로 무료라고 나와 있습니다. Reddit은 2025년 10월 Perplexity와 데이터 스크래핑 회사 3곳을 고소하면서 AI 훈련을 위해 콘텐츠를 수집하려는 "산업 규모" 계획을 주장했습니다.
데이터 자체의 경우 행에는 캡션, 사용된 음악 및 다양한 확인란이 포함됩니다. 제작자 핸들 열은 없지만 캡션, 해시태그, 동영상에 언급된 사람 등을 포함한 많은 데이터와 정보가 표시됩니다. TikTok의 모바일 API에서 수집된 것으로 설명된 45억 개의 동영상 세트 사본도 Hugging Face에 있습니다.