WorldMark는 LLM이 생성한 텍스트의 출처를 추적하는 워터마킹 기법이 국소적인 토큰 통계에만 의존해 개방형 텍스트 생성에서는 신호 배치가 불충분할 수 있다는 문제를 다룬다. 세계 지식 메모리(World Knowledge Memory)로 의미·일화 지식을 메모리 그래프에 정리하고, 이를 토큰 단위 지식 현저성 점수로 변환한 뒤 비대칭 지식 변조(Asymmetric Knowledge Modulation)로 기존 워터마크의 강도를 조정하는 플러그앤플레이 인터페이스다. 백본 재학습이나 별도의 탐지 측 모델·파라미터 없이도, C4 평가에서 3개의 적응형 강도 호스트 변형 전반에 걸쳐 정상 및 공격 상황의 탐지 성능을 개선하면서 perplexity는 소폭 낮췄다. 여러 워터마크 계열에 전이 가능하지만 현저성 인지 변조 없이는 불안정할 수 있음도 함께 확인했다.
- •메모리 그래프 기반 지식 현저성 점수로 워터마크 강도를 조정하는 플러그앤플레이 인터페이스
- •백본 재학습·추가 탐지 모델 없이 적용 가능
- •C4 평가에서 3개 적응형 강도 호스트의 탐지 성능 개선, perplexity는 소폭 감소
- •여러 워터마크 계열에 전이되나 현저성 인지 변조 없이는 불안정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
WorldMark: A Plug-and-Play World Knowledge Interface for Cross-Host Language Model Watermarking
본문 미리보기
arXiv:2608.06416v1 Announce Type: new Abstract: Watermarking traces the provenance of text produced by large language models by embedding statistically detectable signals during decoding. Existing schemes fall into logits-based, sampling-based, entropy-aware, and adaptive-strength families, yet all of them place watermark signals according to local token statistics. In the open-ended text-generation settings evaluated in this work, local statistics may provide insufficient guidance for placing
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



