합성 음성에 다중 비트 식별자를 삽입해 출처를 추적하는 생성형 워터마킹 프레임워크 Thrive가 제안됐다. 자기회귀 TTS의 이산 토큰과 연속 표현 생성 방식 모두에 대응하며, 워터마크 삽입을 생성 과정과 동기화하는 Rise와 파형·스펙트럼 전문가를 비트 단위로 선택 결합하는 Care 기법을 결합했다. 재구성 공격(편집·변환) 상황에서도 평균 87.6%의 복원 정확도를 유지했고, 최대 1만 개 신원 후보군에서도 출처 추적이 가능했다. 음성 합성 품질 저하 없이 워터마크 생존력을 높인 점이 특징이다.
- •자기회귀 TTS의 이산 토큰·연속 표현 생성 모두에 적용 가능한 다중 비트 워터마킹
- •Rise(생성 동기화 삽입)와 Care(비트 단위 신뢰도 선택) 기법 결합
- •재구성(편집) 공격 하에서도 평균 87.6% 복원 정확도 달성
- •최대 1만 개 신원 후보군에서도 발화자 출처 추적 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Learning to Watermark Speech Synthesis Against Model-Driven Reconstruction
- 1.TTS 합성음성에 다중비트 식별자를 삽입해 출처 증명과 사용자 귀속을 지원하는 워터마킹 프레임워크 'Thrive' 제안
- 2.재구성 공격에서 어떤 단일 워터마크 캐리어도 일관되게 살아남지 못함을 발견, 생존률이 삽입구조·복원방식에 따라 달라짐을 규명
- 3.생성 과정에 워터마크를 동기화 삽입하는 'Rise'와 파형·스펙트럼 전문가를 결합하는 'Care'로 구성
- 4.재구성 공격 하에서 평균 87.6% 복원 정확도를 달성, 최대 1만 개 신원 후보군에서도 출처 귀속 성공
왜 중요한가?
합성음성이 대량 생성되면서 편집·변환을 거쳐도 출처를 추적할 수 있는 워터마킹이 필요한데, 기존 방식이 재구성 공격에 취약했던 한계를 구조적으로 보완해 TTS 서비스의 콘텐츠 출처 증명 신뢰성을 높인다.
언급 프로젝트
합성 음성 생성 시스템에서 콘텐츠 출처를 검증하고 사용자에게 귀속시킬 수 있는 워터마킹 기법에 대한 연구입니다. 딥페이크 음성 콘텐츠 확산으로 사회적 우려가 커지는 한국 상황에서, 이러한 워터마크 기술은 합성 음성의 신뢰성을 확보하고 악용을 방지하는 중요한 수단으로 활용될 수 있으며, 관련 규제 논의에도 영향을 미칠 것입니다.
본문 미리보기
arXiv:2610.04235v1 Announce Type: new Abstract: Modern TTS systems increasingly generate synthetic speech at scale for diverse users. This setting calls for content-level provenance that can verify the origin of released speech and attribute it to the requesting user, which generative watermarking can support by embedding multi-bit identifiers directly into synthesized speech. Once released, however, speech may undergo heterogeneous learned transformations during distribution and editing, with
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

