이 논문은 문장 의미에 마크를 결합하는 시맨틱 워터마크가 재구성 공격에 취약함을 보이고 새로운 방어 기법을 제안한다. 연구진이 제안한 임베딩 변위 공격(EDA)은 문장을 바꿔쓰거나 순서를 바꿔도 워터마크를 지울 수 있어, 4개 기존 방식에서 32.6~47.9%의 문서에서 마크를 제거하는 데 성공했다. 이에 대응해 문장 이하 단위에서 순서에 강건하게 탐지하는 k-SwordStamp를 설계해, 강력한 화이트박스 공격에서도 공격 성공률을 k-SemStamp의 65.5%에서 39.7%로 낮췄다. AI 생성 텍스트의 출처 추적 기술이 회피 공격에 맞서 진화하고 있음을 보여주는 연구다.
- •임베딩 변위 공격(EDA)은 문장 재구성만으로 4개 워터마크 기법 중 최대 47.9%의 문서에서 마크를 제거
- •EDA는 공개 패러프레이저와 서로게이트 인코더만으로 작동, 원본 생성기나 비밀키 접근 불필요
- •k-SwordStamp는 문장 이하 단위에서 순서 강건 탐지로 노-박스 공격 성공률을 10.8%로 억제
- •화이트박스급 공격(탐지기·비밀키 접근)에서도 k-SwordStamp의 공격 성공률은 39.7%로 k-SemStamp(65.5%)보다 낮음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Semantic Watermarking with Order-Robust Detection over Sub-sentence Units
- 1.문장 의미에 워터마크를 결속하는 시맨틱 워터마크의 새 회피 공격 'EDA' 제안
- 2.재구성·재배열·재분절 편집이 임베딩을 이동시켜 탐지를 피하는 원리 규명
- 3.EDA는 4개 기존 스킴에서 32.6~47.9% 워터마크 제거에 성공, 테스트한 공격 중 최고 수준
- 4.대응책 'k-SwordStamp' 제안, 강력한 화이트박스 EDA에도 공격성공률을 65.5%에서 39.7%로 완화
왜 중요한가?
콘텐츠를 훼손하지 않는 편집만으로도 AI 생성물 워터마크를 상당수 제거할 수 있음을 보여, 현재 워터마킹 기술의 견고성 평가 기준을 재정립하고 더 강한 방어 설계 필요성을 부각한다.
언급 프로젝트
본문 미리보기
arXiv:2608.27666v1 Announce Type: new Abstract: Semantic watermarks tie the mark to sentence meaning rather than token choices, promising robustness to content-preserving edits. However, the detector only observes attacker-supplied text, which can be reworded, reordered, or resegmented to evade detection without content loss. Rewording, reordering, and resegmentation all cause embedding displacement: detection tests embeddings different from those selected during watermarking and can therefore
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
