이 논문은 LLM 생성 텍스트의 출처 추적과 변조 탐지를 동시에 지원하는 새로운 워터마크 기법을 제안한다. 기존 워터마크는 편집에 강해 출처는 유지되지만, 이 강건성을 악용해 핵심 내용만 몰래 바꾸는 '피기백 스푸핑' 공격에 취약했다. 제안 기법은 각 토큰에 강건한 신호와 취약한 신호를 독립적인 키로 함께 삽입해, 편집에 강한 신호와 눈에 띄는 변경에 민감한 신호를 분리한다. 두 개 대형언어모델과 두 개 프롬프트 데이터셋에서 실험한 결과 기존 방법 대비 가장 높은 변조 탐지율을 보이면서도 출처 귀속 강건성과 텍스트 품질은 경쟁력 있게 유지했다.
- •출처 추적과 변조 탐지를 동시에 지원하는 이중 신호 워터마크 기법 제안
- •기존 워터마크의 강건성을 악용하는 '피기백 스푸핑' 취약점 해결 목표
- •강건한 신호와 취약한 신호를 독립 키로 각 토큰에 공동 삽입
- •두 LLM·두 데이터셋 실험에서 기존 방법 대비 최고 변조 탐지율, 경쟁력 있는 귀속 강건성·품질 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Tracing Provenance and Detecting Tampering with Complementary LLM Watermarks
- 1.기존 LLM 워터마크의 편집 내성이 오히려 '피기백 스푸핑'(귀속성 유지한 채 내용만 변조)에 악용될 수 있음을 지적
- 2.각 토큰에 강건 신호와 취약 신호를 동시 삽입, 서로 다른 키·시딩 윈도로 편집내성과 변조민감성을 분리
- 3.토너먼트 재가중 기법으로 원래 생성분포를 유지하며 주기적 라운드 배분으로 두 신호 트레이드오프 조절
- 4.탐지 시 Intact·Tampered·No-Watermark 3단계 판정, 2개 LLM·2개 데이터셋에서 최고 변조탐지율 달성
왜 중요한가?
출처 추적용 워터마크가 텍스트 변조 자체는 막지 못한다는 취약점을 실증하고, 출처 증명과 변조 탐지를 동시에 만족하는 설계를 제시함으로써 AI 생성 콘텐츠 신뢰성 검증 기술의 공백을 메운다.
본문 미리보기
arXiv:2608.12713v1 Announce Type: new Abstract: Watermarking LLM-generated text is an important task for tracing its provenance. Existing LLM watermarks preserve provenance under editing, but this same robustness allows an adversary to alter critical content while retaining attribution, a vulnerability known as piggyback spoofing. We introduce an innovative watermark that jointly provides provenance and tamper evidence. It co-embeds a robust signal and a fragile signal into each generated token
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

