세바스찬 라슈카가 앤트로픽의 클로드 텍스트 워터마킹 원리를 설명하는 48분 분량의 영상 강의를 공개했다. 워터마킹은 LLM 자체를 재훈련하지 않고 다음 토큰 샘플링 단계에서 비밀 키 기반의 무작위 시드를 적용해 동일 확률의 후보 토큰 중 하나를 결정론적으로 선택하는 방식으로 작동한다. 탐지는 구글의 'SynthID-Text' 기법에서 파생된 토너먼트 샘플링과 채점 함수를 이용해 LLM을 다시 실행하지 않고도 저렴하게 수행할 수 있다. 워터마크 제거는 어떤 위치가 표시됐는지 알 수 없어 무작위 편집에 의존해야 하며, 이 과정에서 텍스트 품질이 오히려 떨어질 수 있다는 설명이다.
- •클로드 워터마킹은 LLM 재훈련 없이 토큰 샘플링 단계에서 비밀 키로 시드를 고정하는 방식
- •구글 'SynthID-Text' 기반 토너먼트 샘플링으로 LLM 재실행 없이 저렴하게 탐지 가능
- •워터마크 위치를 알 수 없어 제거하려면 무작위 편집이 필요, 텍스트 품질 저하 우려
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How Claude Watermarks AI-Generated Text

- 1.Claude 워터마킹은 텍스트 생성 시 무작위 샘플링을 비밀 키 기반 시드로 고정하는 방식
- 2.SynthID-Text 기법의 '토너먼트 샘플링' 사용, 여러 워터마킹 함수 G1~Gn으로 토큰 승부 결정
- 3.탐지는 비밀 키 보유자만 가능, 평균 비트 점수가 임계값 넘으면 워터마크로 판정
- 4.워터마크 제거하려면 여러 위치를 무작위 편집해야 하며 이 과정에서 텍스트 품질 저하 가능성 지적
왜 중요한가?
워터마킹이 LLM 재학습 없이 샘플링 단계에서만 적용되는 경량 기법임을 밝혀, 탐지 비용을 낮추면서도 완전한 제거는 텍스트 품질을 희생해야 함을 보여준다. EU 등 규제 대응 차원에서 주요 LLM 업체들이 유사 방식을 도입할 가능성을 시사한다.
본문 미리보기
A 48-minute video walkthrough of token sampling, watermark detection, and removal
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
