mallo

Google의 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 왜 '읽는 음성'보다 '연출하는 음성'을 강조할까요?

요약 듣기

0:006:11

원문 보기blog.google
요약 보기

이번 발표에서 Google이 내세우는 핵심은, 음성 생성을 단순히 문장을 읽어 주는 기능에서 한 단계 더 밀어 올리겠다는 거예요. 회사 설명에 따르면 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 더 풍부하고 표현력 있는 오디오 경험을 만들기 위한 새 모델이고, 대상도 창작자, 개발자, 기업으로 분명히 적혀 있어요. 또 Google AI Studio나 Gemini API 같은 개발 경로뿐 아니라 Gemini Notebook, Google Vids 같은 제품의 사용자 경험을 더 좋게 하는 맥락에서도 소개돼요. 그러니까 이 발표는 '새 목소리 몇 개가 추가됐다'기보다, 음성을 하나의 제작 수단으로 넓히겠다는 방향 제시에 가까워요.

여기서 TTS라는 말이 조금 낯설 수 있어요. 아주 단순하게는 글자를 음성으로 바꾸는 기술인데, 이번 발표는 그 위에 '연출'을 얹으려는 시도라고 보면 이해가 쉬워요. 가상의 비유로 말하면, 기존 TTS가 정해진 안내 음성 버튼 몇 개 중에서 하나를 고르는 느낌이었다면, 이번 설명은 성우를 캐스팅하고 대사 톤까지 잡는 작은 녹음 스튜디오를 소프트웨어 안에 넣겠다는 쪽에 가까워요. 그래서 Google은 이 모델들을 정적인 프리셋에서 벗어난 '창작 스튜디오'처럼 설명하고, 특히 Flash TTS는 캐릭터 설계와 세밀한 연기 지시에, Flash-Lite TTS는 많은 분량을 비용 효율적으로 처리하는 데 초점을 둔다고 구분해요. 이 구분이 중요한 이유는, 같은 음성 생성이라도 어떤 사람은 한 캐릭터의 개성을 만들고 싶어 하고, 어떤 조직은 대량 더빙이나 음성 에이전트를 안정적으로 돌리고 싶어 하기 때문이에요.

Flash TTS 쪽에서 특히 눈에 띄는 건 '목소리 자체를 설계하는 기능'이에요. 회사는 원래 30개의 기본 목소리에서 출발해 사실상 매우 큰 선택지를 제공한다고 말하고, 그 방법도 몇 갈래로 나눠 설명해요. 하나는 자연어 프롬프트로 역할, 억양, 목소리 특성을 적어서 완전히 새로운 음성을 만드는 방식이고, 다른 하나는 2,000개가 넘는 준비된 음성 라이브러리에서 고르는 방식이에요. 여기에 더해 100개가 넘는 언어와 방언을 다룰 수 있다고 하고, 브랜드를 대표하는 일관된 목소리나 특정 캐릭터 목소리를 계속 유지할 수 있도록 저장·관리 기능도 강조해요. 쉽게 말해, '이번 프로젝트에 어울리는 목소리를 골라 쓴다'를 넘어서 '우리 작업에 맞는 목소리 자산을 만든다'는 그림을 그리고 있는 셈이에요.

이 발표가 더 흥미로운 이유는 목소리를 만든 다음, 그 목소리가 어떻게 연기할지도 세밀하게 건드릴 수 있다고 주장하기 때문이에요. 두 모델 모두 대사를 한 줄씩 조절할 수 있고, 사용자가 직접 무대 지시 같은 힌트를 쓰거나 자연스러운 스크립트 단서로 전달 방식을 유도할 수 있다고 해요. 여기서 핵심은 '무슨 말을 하느냐'만이 아니라 '어떻게 말하느냐'예요. 차분한 고객 응대처럼 말하게 할지, 속삭이는 긴장 장면처럼 말하게 할지를 문장 단위로 조절하겠다는 거죠. 또 긴 오디오에서도 품질과 말속도, 캐릭터의 음색을 유지하려 하고, 한 스크립트 안에서 두 화자가 자연스럽게 번갈아 말하는 장면도 만들 수 있다고 설명해요. backchanneling이라는 낯선 말은 상대 말을 끊지 않으면서 '음', '맞아'처럼 듣고 있다는 신호를 넣는 표현 정도로 이해하면 돼요. 웃음, 한숨, 놀람 같은 비언어 신호도 스크립트에 넣을 수 있다고 하니, 목표는 단순 낭독보다 장면감 있는 대화에 더 가까워 보여요.

Flash-Lite TTS의 자리는 조금 다르게 잡혀 있어요. Google은 이 모델을 대량 처리와 비용 효율 쪽에 맞춘다고 설명해요. 그래서 고용량 더빙, 오디오 콘텐츠 제작, 표현력 있는 음성 에이전트 같은 용도가 앞에 나와요. 중요한 건 '가벼운 모델이라서 표현력이 떨어진다'고 적은 것이 아니라, 톤과 속도, 미묘한 표현 제어는 유지하면서도 규모 있는 작업에 맞게 최적화했다는 식으로 소개한다는 점이에요. 즉 Flash TTS가 깊은 연출과 캐릭터 설계에 무게를 둔다면, Flash-Lite TTS는 많은 분량을 실제 작업 흐름에 맞게 돌리는 쪽의 역할을 맡는 구조라고 읽을 수 있어요.

다만 조건과 한계도 같이 봐야 해요. 음성 복제는 아무 목소리나 가져와 되는 기능으로 적혀 있지 않아요. 자신의 목소리이거나 사용할 권리가 있는 목소리를 30초 샘플로 재현할 수 있다고 되어 있고, 동의 확인과 워터마킹, 자격 증명 같은 보호 장치를 붙였다고 설명해요. 하지만 이 자료만으로는 SynthID나 C2PA가 정확히 어떤 방식으로 작동하는지까지는 알 수 없어요. 또 장시간 오디오에서 화자 드리프트를 '최소화'한다고 했지, 완전히 없앤다고 말하지는 않았어요. 그러니 오래 생성할수록 목소리나 말투가 조금씩 흔들릴 수 있는 문제를 줄이겠다는 주장으로 이해하는 편이 정확해요. 그리고 음성 리믹싱은 '곧 제공'이라고 적혀 있어서, 이미 제공 중인 기능과 앞으로 추가될 기능을 구분해서 읽어야 해요.

전체적으로 보면 Google의 주장은 분명해요. 음성 생성의 중심을 '텍스트를 소리로 바꾸는 일'에서 '목소리와 장면을 설계하는 일'로 옮기겠다는 거예요. Flash TTS는 창의적 통제와 캐릭터 중심 작업을, Flash-Lite TTS는 대규모 제작과 효율을 맡기고, 그 위에 새 목소리 생성, 대형 음성 라이브러리, 권리 기반 음성 복제, 장기 일관성 유지, 두 화자 장면 구성, 비언어 표현 같은 기능을 한 묶음으로 제시해요. 그래서 이 발표를 이해할 때는 단순히 '더 자연스러운 음성'이라는 홍보 문장보다, 어떤 작업에서 얼마나 세밀한 통제가 필요한지, 그리고 권리와 동의 같은 조건을 함께 다뤄야 하는 도구인지까지 같이 보는 게 중요해요.