AI 뉴스 · Google 음성 생성
제미나이 3.8 TTS, 목소리 설계와 제작 목적에 따라 고릅니다
구글이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. 섬세한 연출과 대량 제작에 초점을 나눴으며, 목소리 복제에는 사용 권리와 소유자의 구두 동의가 필요합니다.
이 글에서 다룰 내용
두 모델의 차이, 목소리 설계·복제, 대사 연출, Notebook·Vids 적용 범위, 동의·지역 제한, API 이전과 검수
제미나이 3.8 TTS, 텍스트로 목소리를 만듭니다
Google은 2026년 9월 23일 공식 발표 ‘Gemini 3.8 text-to-speech says hello’를 통해 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. 제작 목적에 따라 선택하는 하나의 AI 음성 생성 제품군입니다.
두 모델은 텍스트를 음성으로 바꾸는 TTS입니다. 범용 Flash 텍스트 모델, 실시간 양방향 대화용 Live, 음성을 글로 옮기는 Transcribe와 역할이 다릅니다.
이번 제미나이 발표는 단순한 낭독을 넘어 목소리와 연기를 구체적으로 조절하는 데 초점을 맞춥니다. 다만 두 모델이 겨냥하는 제작 환경은 다릅니다.
섬세한 연출은 Flash, 대량 제작은 Flash-Lite입니다
Flash TTS는 오디오북·팟캐스트·게임처럼 캐릭터와 감정 표현이 중요한 콘텐츠에 맞춰져 있습니다. 자연어로 역할·억양·음색을 설명하며 100개 이상의 언어와 방언을 지원합니다.
Flash-Lite TTS는 대량 더빙·콘텐츠 제작·음성 에이전트에 필요한 처리량, 낮은 지연, 비용 효율에 초점을 맞춥니다. 역시 100개 이상의 언어와 방언을 지원하지만 두 모델의 지원 범위가 완전히 같지는 않습니다.
선택 기준은 섬세한 연출과 대량 처리 중 무엇이 중요한지입니다. 구체적인 가격이나 비용 절감률은 이 글에서 제시하지 않습니다. 한국어 품질과 필요한 방언의 발음은 실제 결과를 듣고 판단해야 합니다.
목소리 설계와 실제 목소리 복제는 다릅니다
Flash 중심의 도구에는 2,000개 이상의 준비된 목소리 라이브러리와 새 목소리 설계 기능이 포함됩니다. 자신이나 사용 권리를 확보한 사람의 30초 음성 샘플로 프로필을 복제하고 만든 목소리를 저장·관리할 수도 있습니다.
목소리 설계는 새로운 목소리를 만드는 작업이고 복제는 실제 화자의 음성을 참조하는 작업입니다. 복제에서는 원하는 음색뿐 아니라 해당 목소리를 사용할 권리와 동의가 중요합니다.
두 모델 모두 줄 단위 연기·속도 지시, 두 화자 대본과 대화 턴 분리, 웃음·한숨·맞장구 같은 비언어 소리를 지원합니다. 기존 목소리의 음색·높낮이·속도·억양을 세부 변경하는 Voice remixing은 아직 제공 예정입니다.
Google은 장문 오디오의 음색 일관성을 개선했다고 설명합니다. 다만 API에는 입출력 토큰 한도가 있으므로 한 번의 요청으로 몇 시간짜리 음성을 제한 없이 생성한다고 받아들여서는 안 됩니다.
Notebook·Vids 적용과 개발자 기능을 구분합니다
두 모델은 9월 23일부터 Gemini API와 Google AI Studio에 순차적으로 제공됩니다. 구글 AI 스튜디오에서는 새 목소리 설계, 본인 목소리 복제, 두 화자 대본 편집기를 제공합니다.
Flash TTS는 Gemini Notebook에, Flash-Lite TTS는 Google Vids에 적용되기 시작합니다. 기반 모델 적용과 모든 목소리 도구의 공개는 별개이므로 복제 기능까지 각 제품 화면에서 사용할 수 있다고 보면 곤란합니다.
AI Studio·API의 개발자 기능과 소비자 제품의 제공 범위는 따로 확인해야 합니다. Gemini Enterprise를 통한 두 모델의 API 제공은 예정 단계이며 Gemini 앱 전체나 모든 요금제·한국 계정에 즉시 제공된다고 확대 해석할 수 없습니다.
목소리 복제에는 동의와 지역 조건이 따릅니다
목소리 복제에는 참조 화자와 일치하는 음성 소유자의 구두 동의 녹음이 필요합니다. API로 복제하더라도 권리 없는 타인의 음성을 사용할 권한이 생기지는 않으며 샘플 보유만으로 충분하지 않습니다.
안전장치에는 동의 확인, SynthID 워터마크, C2PA 출처 정보가 포함됩니다. 이러한 장치가 모든 사칭·권리 문제를 해결하거나 상업적 이용 권리를 자동으로 보장하지는 않습니다.
공식 발표 각주에 따르면 AI Studio의 목소리 복제는 미국 일리노이·텍사스, EEA(유럽경제지역), 영국, 스위스, 인도에서 이용할 수 없습니다. 이는 AI Studio 복제 기능의 제한이며 해당 지역에서 TTS의 모든 기능이 차단된다는 설명은 아닙니다.
한국이 목록에 없다는 이유로 모든 한국 계정의 이용 권한을 보장할 수도 없습니다. 실제 사용 전에는 계정에 제공되는 기능과 적용 조건을 확인해야 합니다.
기존 코드는 대본 입력과 WAV 처리를 점검합니다
새 API 스키마는 입력 텍스트를 대본 그대로 읽습니다. ‘밝게 읽어줘’ 같은 지시나 화자 라벨을 본문에 섞으면 해당 문구까지 소리 내 읽힐 수 있으므로 지속적인 말투와 화자 이름은
speech_metadata
의
style
·
speaker
로 분리합니다.
일반 단일 응답의 기본 출력은
WAV
입니다. 이전 raw
PCM
출력에
WAV
헤더를 붙이던 코드는 중복 헤더를 점검해야 하며 스트리밍까지 같은 기본값이라고 가정해서는 안 됩니다.
제작할 때는 권리와 동의를 확보한 뒤 같은 짧은 대본으로 두 모델을 비교하는 방법을 권합니다. 한국어 고유명사·숫자·호흡을 직접 듣고 장편은 구간을 나눠 화자의 일관성을 확인합니다.
이는 공식적인 제작 효과 보장이 아니라 일반적인 검수 권고입니다. 모델의 특성만큼 제공 범위와 동의 조건, 실제 출력까지 함께 살피는 것이 중요합니다.
한 줄 요약: 제미나이 3.8 TTS는 연출과 대량 제작의 선택지를 넓혔지만, 목소리 복제 권한과 제품별 제공 범위는 따로 확인해야 합니다.
참고 출처
- 구글 공식 TTS 출시 발표와 지역 제한
- Gemini 3.8 Flash TTS 공식 모델·이전 가이드
- Gemini 3.8 Flash-Lite TTS 공식 모델 문서
- Google News RSS에서 확인하기
구글의 2026년 9월 23일 공식 발표와 9월 24일 확인한 모델 문서를 기준으로 작성했습니다. 성능·품질 설명은 구글 발표 기준이며, 서비스별 제공 기능과 이용 조건은 구분해야 합니다.
