TextCloak은 무단 LLM 학습 및 데이터 유출로부터 텍스트 데이터를 보호하기 위한 강화학습(RL) 기반 프레임워크로, 정교한 섭동을 가해 모델이 해당 데이터로 학습해도 성능이 저하되는 "학습 불가능한 예제(unlearnable examples)"를 생성한다. 기존 텍스트 보호 기법이 판별형 언어모델의 분류 작업(감성분석 등)에 초점을 맞춰 클래스별 언어적 단서 주입에 의존한 탓에 LLM의 개방형 생성 환경에서는 효과가 제한적이었던 한계를 극복하고자, TextCloak은 생성형 정책을 이용해 원본 텍스트 묶음을 의미적 충실성과 자연스러움을 유지하면서 학습 불가능한 텍스트로 변환한다. 정책 최적화를 위해 미세조정된 대리 LLM에서 유발되는 하류 성능 저하를 보상으로 삼아 그룹 상대 정책 최적화로 생성기 파라미터를 갱신하는 GRPO-UE를 도입해, 클래스별 단서를 넘어서는 일반화 가능한 보호 패턴을 발견할 수 있게 했다. 공개 데이터셋 6개와 최신 LLM 9개에 대한 종합 실험에서 TextCloak은 정당한 사용을 위한 텍스트 유용성을 유지하면서도 무단 미세조정을 지속적으로 방해했으며, 모델 구조·훈련 설정·적응형 공격에 걸쳐 전이성과 견고성을 입증했다.
- •강화학습 기반으로 의미적 충실도와 자연스러움을 유지하면서 학습 불가능한 텍스트를 생성하는 TextCloak 프레임워크 제안
- •기존 방법의 클래스별 언어적 단서 의존 한계를 극복해 LLM의 개방형 생성 환경에도 적용 가능
- •대리 LLM의 하류 성능 저하를 보상으로 삼는 GRPO-UE로 일반화 가능한 보호 패턴 학습
- •공개 데이터셋 6개와 최신 LLM 9개에서 무단 미세조정 지속적 방해를 입증
- •모델 구조·훈련 설정·적응형 공격에 걸친 전이성과 견고성 확보
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text
본문 미리보기
arXiv:2607.28862v1 Announce Type: cross Abstract: The rapid development of Large Language Models (LLMs) has led to significant advances across a wide range of language tasks, while simultaneously raising growing concerns about unauthorized data exploitation and privacy leakage. Unlearnable examples (UEs) offer a promising defense by introducing carefully designed perturbations into data such that models trained on them exhibit degraded utility. However, existing methods for text protection are
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



