TCF(Targeted Counterfactual Fingerprinting)는 쿼리 API로만 노출되는 LLM의 블랙박스 소유권 검증을 위한 워터마킹 프레임워크다. 기존 방식은 전체 텍스트 매칭이나 모델별 특화 프롬프트처럼 최종 응답 인터페이스에서 취약한 신호에 의존했지만, TCF는 검증 질의를 유한한 답변 공간으로 제한해 표면형 모호성을 줄이고, 원본 프롬프트의 정상 답변과 다른 반사실적(counterfactual) 목표로 향하는 프롬프트 섭동을 최적화한다. 검증은 의심 모델의 파싱된 최종 답변이 기록된 목표와 일치하는지 확인하는 문제로 단순화된다. 보호모델만으로 목표의 사전 발생 가능성이 낮고 섭동 후 발생 가능성이 높음을 인증하는 소스모델 반사실 마진(SCM)을 도입해 목표 선택과 섭동 중단, 지문 필터링을 통제한다. 4개 LLM 계열에 대한 실험에서 평균 AUC 0.9861을 달성해 TRAP, ProFLingo, ZeroPrint 대비 0.07~0.19포인트 향상됐다.
- •블랙박스 LLM 소유권 검증을 제한 답변 공간 반사실적 전이 문제로 재구성한 TCF 제안
- •정상 답과 다른 반사실적 목표로 향하는 프롬프트 섭동을 최적화해 검증
- •소스모델 반사실적 마진(SCM)으로 목표 선택·섭동 중단·지문 필터링 통제
- •4개 LLM 계열에서 평균 AUC 0.9861로 기존 기법 대비 0.07~0.19 포인트 상승
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification
본문 미리보기
arXiv:2608.08195v1 Announce Type: new Abstract: Large language models (LLMs) are high-value assets that can be derived through redeployment, fine-tuning, quantization, or further alignment. Because deployed LLMs are commonly exposed only through query APIs, ownership verification must often rely on black-box text responses. This setting is difficult: generations are open-ended and can vary across repeated queries, while existing black-box fingerprints rely on signals that are fragile under a fi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



