구글 딥마인드, Gemini 3.8 음성생성 모델 두 종 공개

구글 딥마인드가 Gemini 오디오 제품군에 새 텍스트음성변환(TTS) 모델 두 개를 추가했습니다. Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 자연어 프롬프트로 목소리를 새로 설계하거나 복제하고, 대사를 한 줄씩 연출할 수 있는 모델입니다.
1/생성형 음성 모델 두 가지 공개
구글 딥마인드는 2026년 9월 24일 0시 25분(한국 시각, 9월 23일 15시 25분 UTC) Gemini 오디오 제품군에 새 TTS 모델 두 개를 추가했다고 발표했습니다. Gemini 3.8 Flash TTS는 캐릭터 목소리를 처음부터 만들고 대사를 한 줄씩 연출하는 데 초점을 맞춘 모델이고, Gemini 3.8 Flash-Lite TTS는 대량 더빙과 음성 에이전트처럼 비용 효율이 중요한 용도에 맞춘 모델입니다. 두 모델은 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, 3.8 Live Extended Thinking에 이어 나온 Gemini 오디오 제품군의 신규 라인업입니다.
2/Hume AI 벤치마크서 1위 기록
Gemini 3.8 Flash TTS는 Hume AI의 Voice Design Benchmark 종합 순위 1위(71.4점)를 기록했고, 억양 재현(accent modeling) 항목에서도 1위(60.8점)를 차지했다고 밝혔습니다. Hume AI의 Overall Quality Index에서는 Flash TTS가 1위, Flash-Lite TTS가 2위에 올랐습니다. 구글은 이전 모델인 Gemini 3.1 Flash TTS와 비교해 긴 분량 콘텐츠와 2인 대화 대본 연출에서 크게 개선됐다고 설명했습니다. 블라인드 사용자 선호도 평가인 Voice Arena에서는 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어 등 주요 언어에서 상위권을 차지했다고 합니다.
3/AI Studio부터 Vids까지, 9월 23일 순차 제공
Gemini 3.8 Flash TTS와 Flash-Lite TTS는 9월 23일부터 순차 제공됩니다. 개발자는 Gemini API와 Google AI Studio에서 바로 쓸 수 있고, 기업 고객용 Gemini Enterprise API는 추후 제공될 예정입니다. 일반 사용자는 Flash TTS를 Gemini Notebook에서, Flash-Lite TTS를 Google Vids에서 사용할 수 있습니다. 100개 이상 언어와 방언을 지원하며, 2,000개가 넘는 완성형 목소리 라이브러리와 자연어 프롬프트로 새 목소리를 설계하는 기능, 30초 분량 샘플로 목소리를 복제하는 기능도 제공합니다. Agora, LiveKit, Pipecat, Vercel 같은 개발자 플랫폼과 Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang 등이 이 모델을 연동하고 있습니다.
4/가격 미공개, 목소리 복제는 지역 제한
공지에는 단가 정보가 없습니다. 목소리 복제 기능을 쓰려면 목소리 주인의 음성 동의 녹음이 참조 음성과 일치해야 하는 동의 확인 절차를 거쳐야 하며, 생성된 모든 오디오에는 SynthID 워터마크와 C2PA 크리덴셜이 적용됩니다. Google AI Studio를 통한 목소리 복제 기능은 일리노이, 텍사스, 유럽경제지역(EEA), 영국, 스위스, 인도에서는 제공되지 않는다고 명시했습니다.
5/프리셋에서 연출로 넘어가는 음성 생성AMEET 해석
목소리를 처음부터 설계하고 대본을 줄 단위로 연출하는 방식은 정해진 프리셋 목소리 중 고르던 기존 방식과 다른 접근입니다. 오디오북, 팟캐스트, 게임 캐릭터 더빙처럼 긴 분량과 다중 화자가 필요한 제작 환경에서 활용도가 갈릴 것으로 보입니다. 다만 음성 복제 기능이 여러 지역에서 제한된다는 점은 실제 도입 속도에 영향을 줄 수 있습니다.