LLM 워터마크가 의료 텍스트 성능에 미치는 영향을 처음으로 엄밀하게 분석한 연구다. 워터마킹 기법 5종을 LLM 11개와 VLM 7개에 적용해 단일·멀티모달 임상 추론 태스크에서 벤치마킹했고, 의료 전문가가 검증한 파이프라인으로 의학적 추론 품질, 용어 정밀성, 유발된 환각을 체계적으로 감사했다. 그 결과 워터마킹이 어휘 손상, 환각된 의학 용어, 영상 소견의 오귀속·누락 증폭 등 여러 실패 모드에서 상당한 성능 저하를 유발함을 확인했다. 특히 도메인 특화 분석 없이 집계 지표만 쓰면 임상적으로 중대한 실패가 체계적으로 가려질 수 있다. 의료처럼 작은 토큰 변화가 큰 의미 변화를 일으키는 도메인에서는 워터마크 모델 배포 전 도메인 특화 평가가 전제 조건임을 보여준다.
- •워터마크 5종×LLM 11개·VLM 7개로 의료 태스크 영향을 분석한 최초의 엄밀한 연구
- •전문가 검증 파이프라인으로 추론 품질·용어 정밀성·환각을 체계적 감사
- •어휘 손상, 환각 용어, 영상 소견 오귀속·누락 증폭 등 다양한 실패 모드 확인
- •집계 지표만으로는 임상적 중대 실패가 가려짐—의료 배포 전 도메인 특화 평가가 필수
Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts
본문 미리보기
arXiv:2607.20462v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly integrated into clinical workflows, stressing the need for reliable traceability of model-generated output with watermarking. Yet, most watermarks are evaluated on general-purpose benchmarks, leaving domains like medicine, where small token-level perturbations can result in significant semantic changes, underexplored. In this work, we present the first rigorous study of how LLM watermarks affect medica
전체 내용이 궁금하다면?
원문을 직접 읽어보세요