구글이 자연어 프롬프트만으로 새로운 음성을 설계하고 대사별 연기와 억양까지 세밀히 조절할 수 있는 텍스트 음성 변환 모델 '제미나이 3.8 플래시 TTS'와 '플래시-라이트 TTS'를 23일 공개했다. 두 모델 모두 100개 이상 언어와 방언을 자동 감지하며, 웃음이나 한숨 같은 비언어적 표현과 두 화자 간 자연스러운 대화까지 스크립트만으로 구현할 수 있다. 흄 AI의 보이스 디자인 벤치마크에서 71.4점으로 종합 1위를 기록했으며, 종합 품질 지수에서도 플래시(0.920점)와 플래시-라이트(0.914점)가 각각 1·2위에 올랐다. 생성 음성에는 워터마크 신스ID가 삽입되며, 본인 동의를 확인한 음성만 30초 샘플로 복제할 수 있는 기능도 지원한다.
- •구글, 자연어 프롬프트로 음성을 설계하는 '제미나이 3.8 플래시 TTS'와 '플래시-라이트 TTS' 공개
- •100개 이상 언어·방언 자동 감지, 웃음·한숨 등 비언어적 표현과 2인 대화 구성 지원
- •흥 AI 보이스 디자인 벤치마크 71.4점으로 1위, 종합 품질 지수도 1·2위 석권
- •생성 음성에 신스ID 워터마크 삽입, 동의 확인된 음성만 30초 샘플로 복제 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글, '제미나이 3.8 플래시 TTS' 공개...'음성 디자인' 패러다임 연다

- 1.구글, 자연어 프롬프트로 음성 설계하는 '제미나이 3.8 플래시 TTS' 2종 공개
- 2.100개 이상 언어·방언 자동감지, 2000개 이상 상용급 기본 음성 라이브러리 제공
- 3.흄 AI 보이스 디자인 벤치마크서 71.4점으로 1위, 종합품질지수 0.920으로 1위 기록
- 4.모든 생성 음성에 신스ID 워터마크 삽입, 30초 샘플 기반 음성 복제는 동의 확인 필수
왜 중요한가?
음성을 '고르는 것'에서 '설계하는 것'으로 전환해 캐릭터별 연기·억양까지 프롬프트로 조절 가능해졌다는 점에서, 게임·오디오북·더빙 등 콘텐츠 제작 워크플로우에서 성우 캐스팅 과정을 대체할 수 있는 실용적 진전이다.
본문 미리보기
구글이 자연어 프롬프트만으로 새로운 음성을 설계하고 대사별 연기와 억양까지 세밀하게 조절할 수 있는 텍스트 음성 변환(TTS) 모델 2종을 출시했다. 기존의 고정된 음성 선택 방식에서 벗어나 게임, 오디오북, 팟캐스트, 더빙, 음성 에이전트 등 다양한 분야에서 맞춤형 음성을 제작할 수 있도록 한 것이 특징이다.구글은 23일(현지시간) 제미나이 오디오 제품군에 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS'를 추가했다고 밝혔다.플래시 TTS는 창작자와 개발자가 캐릭터 음성을 처음부터 설계하고 세밀하게 연출
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

