Gemini 3.8 Flash TTS 공개 — 프롬프트로 캐릭터 목소리를 만들고 대사마다 연기를 지시합니다 | DAKER 커뮤니티
이제 목록에서 목소리를 고르는 대신, 말로 설명해서 목소리를 만듭니다. Google이 9월 23일 공개한 Gemini 3.8 Flash TTS와 Flash-Lite TTS가 바꾼 점입니다. 캐릭터의 성격과 말투를 글로 적으면 새 목소리가 만들어지고, 대사 한 줄마다 연기를 따로 지시할 수 있습니다. 더빙, 음성 에이전트, 교육용 오디오를 만드는 팀이라면 작업 방식이 달라질 수 있는 소식이라 차례로 정리했습니다.
두 모델은 역할이 다릅니다
Flash TTS는 창작과 캐릭터 디자인에 맞춘 모델입니다. 역할, 억양, 성격을 자연어로 설명하면 새 목소리를 만들어 주고, 대사마다 연기 톤과 속도, 사투리, 추임새까지 지시할 수 있습니다.
Flash-Lite TTS는 대량 작업용입니다. 대규모 더빙이나 오디오 콘텐츠, 감정 표현이 필요한 음성 에이전트처럼 양이 많은 일에 쓰도록 만들었습니다. 톤과 속도, 뉘앙스는 세밀하게 조절하면서 비용을 낮추는 쪽에 무게를 뒀습니다.
두 모델은 앞서 나온 Live Translate, Transcribe, Live 모델들과 함께 Gemini의 오디오 모델 제품군을 이룹니다.
무엇을 할 수 있나
Google이 밝힌 기능은 다음과 같습니다.
- 100개 넘는 언어와 방언, 2,000개 넘는 기본 목소리
- 30초 샘플로 목소리 복제(본인 동의 확인 절차 포함)
- 두 화자가 주고받는 장면 연출
- 긴 분량을 만들어도 음색 유지
- 대본 안의 지시문으로 연기 조절
- SynthID 워터마크와 C2PA 출처 정보 자동 삽입
성능 면에서는 Hume AI의 목소리 디자인 벤치마크에서 Flash TTS가 종합 1위(71.4점), 억양 표현 60.8점을 기록했다고 합니다. Voice Arena에서는 일본어, 브라질 포르투갈어, 베트남어, 표준 아랍어, 멕시코 스페인어, 힌디어 등에서 상위권에 올랐습니다.
한국어 순위는 발표에 나오지 않습니다. "한국어에서도 1위"라고 전하면 사실이 아닙니다.
어디서 쓸 수 있고, 무엇이 제한되나
Flash TTS는 Google AI Studio와 Gemini API 등에 순차적으로 열리고 있습니다. Flash-Lite TTS는 개발자 API, AI Studio, Google Vids에서 쓸 수 있고, 기업용 API는 곧 나올 예정입니다.
목소리 복제에는 지역 제한이 있습니다. AI Studio에서의 복제 기능은 미국 일리노이주와 텍사스주, 유럽경제지역, 영국, 스위스, 인도에서는 쓸 수 없습니다. 한국은 목록에 없지만, 조직 계약이나 기능 설정에 따라 다를 수 있으니 콘솔에서 직접 확인하는 것이 확실합니다.
꼭 지켜야 할 선
이번 발표는 동의 확인, 워터마크, 투명성을 전제로 합니다. 유명인이나 동료의 목소리를 동의 없이 복제하는 것은 허용되지 않습니다. 워터마크가 들어간다고 해서 마음대로 써도 된다는 뜻도 아닙니다. 생성한 음성을 공개할 때는 AI로 만든 목소리라는 사실을 함께 밝혀 주세요.
우리 팀에 들인다면: 3단계 도입 가이드
1단계. 용도를 나눕니다
먼저 두 모델의 쓰임새를 팀 안에서 한 문장으로 정해 두세요.
캐릭터 목소리, 내레이션, 대사별 연기가 필요하면 Flash TTS, 대량 더빙이나 음성 에이전트처럼 비용이 중요하면 Flash-Lite TTS를 쓴다.
2단계. 동의 절차를 먼저 만듭니다
브랜드 목소리를 복제할 계획이라면 녹음 동의 절차를 법무팀, 마케팅팀과 먼저 맞추세요. 복제 작업은 일반 작업과 따로 관리하고, 동의 문서를 어디에 보관할지도 정해 둬야 합니다. SynthID와 C2PA 고지 문구는 콘텐츠 가이드에 넣어 두면 좋습니다.
3단계. 같은 대본으로 들어 봅니다
같은 대본을 Flash와 Flash-Lite로 각각 만들어 듣고, 선호도, 알아듣기 쉬운 정도, 비용을 표로 비교해 보세요. 해커톤 데모에 쓴다면 전날 목소리 설정을 고정하고, 첫 화면에 생성 음성이라는 안내를 넣는 것을 권합니다.
마치며
Gemini 3.8 TTS는 목소리를 고르는 도구에서 목소리를 연출하는 도구로 넘어가는 변화입니다. 표현력이 커진 만큼 동의와 고지 같은 기본 원칙이 더 중요해졌습니다. 여러분은 이 기능을 어떤 콘텐츠에 먼저 써 보고 싶으신가요? 댓글로 아이디어를 나눠 주세요.
참고 자료
- Google, Gemini 3.8 TTS 발표 (2026년 9월 23일): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/