PD-GS는 3D Gaussian Splatting 기반 토킹헤드 렌더링에서 입술 조음의 부정확성을 해결하기 위해 음소(phoneme) 정보를 결합한 모델이다. ASR과 강제 정렬로 얻은 시간 정렬 음소 토큰을 연속적인 오디오 임베딩과 학습 가능한 게이트로 융합하는 Linguistic Fusion Module(LFM)을 핵심으로 한다. HDTF 벤치마크에서 입술 기하 오차(LMD) 2.66으로 비교 모델 중 최고 성능을 기록했으며, 조음 제약 위반을 줄여 더 자연스러운 신경 아바타를 만들어냈다. 오디오 기반 립싱크의 고질적 문제였던 '새는 입' 현상을 언어학적 근거로 개선했다는 점에서 의미가 크다.
- •ASR·강제정렬로 얻은 음소 토큰을 오디오 임베딩과 게이트로 융합하는 LFM 모듈 제안
- •HDTF 벤치마크에서 입술 기하 오차(LMD) 2.66으로 최고 성능 달성
- •양순음 폐쇄 등 조음 제약 위반('leaky mouth' 현상)을 크게 줄임
- •모노큘러 비디오만으로 이미지 재구성과 입술 랜드마크 지도학습으로 훈련
- •ACM MM 2026 채택 논문
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads
본문 미리보기
arXiv:2608.05218v1 Announce Type: new Abstract: 3D Gaussian Splatting (3DGS) enables fast, photorealistic talking-head rendering, yet accurate lip articulation remains elusive: mouth motion is often over-smoothed and may violate hard articulatory constraints such as bilabial closures, producing the notorious ``leaky mouth'' artifact. A key difficulty is that brief, discrete articulatory events are inferred from a continuous acoustic embedding under a regression objective, which biases predictio
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

