2026년 9월 24일 목요일
METABRIEF — Insights. Connection. Innovation.
AI

구글 딥마인드, 목소리 설계·복제 기능 갖춘 TTS 모델 '제미나이 3.8' 2종 공개

구글 딥마인드는 공식 블로그를 통해 텍스트를 음성으로 바꾸는(TTS) 신규 모델 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS'를 공개했다고 밝혔다. 회사는 두 모델을 지금까지 내놓은 오디오 생성 모델 가운데 표현력이 가장 뛰어난 모델로 소개했다.


새 모델을 쓰면 기존의 음성 프리셋 30종에서 벗어나, 자연어 프롬프트만으로 억양과 감정 톤을 지정해 새로운 캐릭터 목소리를 만들 수 있다. 대사를 한 줄씩 연출할 수 있고 두 화자가 나누는 대화 장면도 제어할 수 있으며, 지원 언어는 100개가 넘는다. 구글 딥마인드는 플래시 TTS가 Hume AI의 보이스 디자인 벤치마크에서 71.4점으로 종합 1위에 올랐다고 밝혔다.


목소리 복제는 본인 동의를 확인한 경우에만 쓸 수 있다. 목소리 주인이 직접 녹음한 동의 음성을 제출해야 하고, 이 음성이 참조 화자와 일치해야 한다. 생성된 모든 오디오에는 AI 생성물임을 식별할 수 있는 워터마크 'SynthID'가 삽입된다. 두 모델은 발표 당일부터 구글 AI 스튜디오와 제미나이 API 등을 통해 순차적으로 제공된다.



메타브리프 편집팀 메타브리프 기자