이 논문은 잠재 확산모델(LDM) 이미지의 안전장치로 여겨지는 시맨틱 워터마킹이, 탐지 파이프라인이 신경망에 의존한다는 점에서 백도어 공격에 취약할 수 있음을 보인다. 연구진이 제안한 GhostVAE는 VAE 인코더에 은밀한 백도어를 심어 워터마크 탐지를 회피하게 만드는 공격으로, 먼저 파워 스펙트럼 정규화로 강건한 범용 트리거를 만들고 이어 매개변수 정렬 목적함수로 백도어가 심긴 인코더를 학습시키는 2단계로 동작한다. 3가지 최신 시맨틱 워터마킹 기법과 3가지 널리 쓰이는 LDM에 대한 광범위한 평가에서, GhostVAE는 정상 이미지에 대해서는 평균 94.4%의 워터마크 탐지 성능(참양성률)을 그대로 유지하면서도, 트리거가 활성화되면 평균 94.6%의 공격 성공률로 탐지를 회피했다. 17가지 대표적 방어 기법을 분석한 결과 GhostVAE는 입력·매개변수·잠재 공간 전반에서 은밀성을 유지하는 것으로 나타나, 시맨틱 워터마킹 시스템의 신뢰성을 근본적으로 흔드는 결과로 평가된다.
- •LDM 워터마크 탐지가 신경망에 의존한다는 점을 노린 백도어 공격 GhostVAE 제안
- •파워 스펙트럼 정규화로 범용 트리거 생성 후 매개변수 정렬 학습으로 백도어 삽입
- •정상 이미지 워터마크 탐지율 평균 94.4% 유지하면서 트리거 시 공격 성공률 94.6%
- •3개 워터마킹 기법·3개 LDM에서 검증, 17가지 방어 기법에도 은밀성 유지
- •시맨틱 워터마킹의 안전한 배치에는 신경망 구성요소 포함 종단간 보안 고려 필요성 제기
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor
- 1.LDM 시맨틱 워터마크 탐지 파이프라인의 신경망 의존성을 노린 백도어 공격 GhostVAE 제안
- 2.전력 스펙트럼 정규화로 범용 트리거 생성 후 파라미터 정렬 목표로 백도어 VAE 인코더 학습
- 3.최신 워터마킹 3종·LDM 3종에서 정상 이미지 탐지율 94.4% 유지하며 공격 성공률 94.6%
- 4.대표 방어 17종 분석에서도 입력·파라미터·잠재 공간 전반에서 은닉성 유지
왜 중요한가?
AI 생성 이미지 식별 수단으로 기대받는 시맨틱 워터마킹이 탐지 파이프라인 내부 신경망(VAE 인코더) 백도어 하나로 무력화될 수 있음을 보였다. 워터마크 신뢰성 논의가 알고리즘 자체를 넘어 신경망 구성요소를 포함한 엔드투엔드 보안으로 확장돼야 함을 시사한다.
언급 프로젝트
본문 미리보기
arXiv:2608.00543v1 Announce Type: new Abstract: Although semantic watermarking is considered a promising safeguard for images generated by Latent Diffusion Models (LDMs), the reliance of the watermark detection pipeline on neural networks introduces a critical yet underexplored backdoor attack surface. To systematically study this vulnerability, we propose GhostVAE to plant a stealthy backdoor into the encoder of Variational Autoencoder (VAE), enabling reliable evasion of watermark detection. G
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:35AI 초안

