엔비디아, 최대 8명 실시간 구분 음성 모델 공개
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 엔비디아가 최대 8명의 발화를 실시간으로 구분하는 1억 파라미터급 음성 화자분리 모델을 공개했다.
- 입력 버퍼 지연시간은 0.32초부터 30.4초까지 조정할 수 있다.
- 엔비디아($NVDA)가 최대 8명의 발화를 실시간으로 구분하는 1억 파라미터급 음성 화자분리 모델 네모트론 3 다이어리제이션(Nemotron 3 Diarization)을 공개했다.
본문
엔비디아가 최대 8명의 발화를 실시간으로 구분하는 1억 파라미터급 음성 화자분리 모델을 공개했다. 입력 버퍼 지연시간은 0.32초부터 30.4초까지 조정할 수 있다. 엔비디아($NVDA)가 최대 8명의 발화를 실시간으로 구분하는 1억 파라미터급 음성 화자분리 모델 네모트론 3 다이어리제이션(Nemotron 3 Diarization)을 공개했다. 모델은 회의록 작성, 콜센터 분석, 음성 기반 AI 에이전트 등에 활용할 수 있는 공개 가중치 모델이다. 엔비디아는 23일 Hugging Face 게시물을 통해 모델을 공개했다. 네모트론 3 다이어리제이션은 Hugging Face와 NeMo에서 사용할 수 있으며, 녹음 파일 처리와 실시간 스트리밍을 하나의 모델로 지원한다. 이 기능은 화자가 처음 등장한 순서에 따라 라벨을 부여하고 다음 음성 구간에서도 같은 라벨을 유지해, 구간이 바뀔 때 화자 번호가 뒤바뀌는 문제를 줄인다.
엔비디아는 공개·라이선스 음성 데이터를 활용해 모델을 학습했으며 David AI의 다화자 음성 데이터도 포함했다고 밝혔다. Hugging Face 모델 페이지와 Baseten은 라이선스를 OpenMDW-1.1로 표시하고 있으며, Baseten은 스트리밍과 배치 추론을 위한 배포 환경을 제공한다. 음성 모델을 국내 회의록이나 콜센터에 적용하려면 지원 언어뿐 아니라 처리 지연시간, 비용, 화자 라벨의 안정성을 함께 확인해야 한다. 다만 엔비디아가 공개 모델 생태계 확대를 이어가는 흐름 에서 음성 처리 모델까지 공개 범위를 넓혔다는 점은 확인됐다. 엔비디아는 기존 대형언어모델 중심의 공개 모델 전략을 음성 처리 영역으로 확장했다.