LIVE MARKET
MARKET시세 연결 중
← 실시간 뉴스로

구글, 130개 언어 음성 모델 출시…대사별 감정 조정

제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.

KEY POINTS

핵심 포인트

  • 구글이 대사별 억양과 감정, 방언을 조정할 수 있는 제미나이 3.8 플래시 TTS를 출시했다.
  • 구글 ($GOOGL)이 대사별 억양과 감정, 방언을 조정할 수 있는 제미나이 3.8 플래시 TTS(Gemini 3.8 Flash TTS)를 출시했다.
  • 음성 생성 기능을 단순 낭독에서 캐릭터 제작과 다중 화자 콘텐츠 구성으로 확장한 것이 핵심이다.
시장 반응 중립GOOGL
ARTICLE BRIEF

본문

구글이 대사별 억양과 감정, 방언을 조정할 수 있는 제미나이 3.8 플래시 TTS를 출시했다. 구글 ($GOOGL)이 대사별 억양과 감정, 방언을 조정할 수 있는 제미나이 3.8 플래시 TTS(Gemini 3.8 Flash TTS)를 출시했다. 음성 생성 기능을 단순 낭독에서 캐릭터 제작과 다중 화자 콘텐츠 구성으로 확장한 것이 핵심이다. 구글은 23일 제미나이 3.8 플래시 TTS와 제미나이 3.8 플래시 라이트 TTS(Gemini 3.8 Flash-Lite TTS)를 공개했다. 플래시 TTS는 음성 품질과 표현력에, 플래시 라이트 TTS는 대량 생성과 저지연 음성 에이전트에 초점을 맞췄다. 제미나이 3.8 플래시 TTS는 자연어 프롬프트로 새로운 목소리를 만들고 대사 단위로 말투와 속도, 감정, 억양을 지시할 수 있다. 두 모델에는 30초 분량의 오디오 샘플을 활용한 음성 복제 기능이 포함됐다.

구글은 음성 복제 과정에서 동의 확인을 요구하고, 생성된 음성에는 인공지능 생성물임을 식별할 수 있는 SynthID 워터마크를 적용한다고 설명했다. 구글 개발자 문서에 따르면 플래시 TTS는 130개 언어, 플래시 라이트 TTS는 101개 언어를 지원한다. Crypto Briefing은 제미나이 3.8 플래시 TTS가 Artificial Analysis의 ‘Pronunciation Robustness Benchmark’에서 89.5%를 기록해 1위에 올랐다고 보도했다. 이번 모델은 앞서 구글이 실시간 음성 대화와 확장 추론을 지원하는 제미나이 3.8 라이브 모델 2종을 공개한 것 과는 용도가 다르다. 다국어와 방언 처리 품질, 응답 지연시간, 생성 비용, 장시간 음성의 안정성, 음성 복제에 대한 동의와 추적 가능성을 함께 확인해야 한다.