연구진은 대규모 언어모델이 학습 데이터에서 생일, 전화번호, 집 주소 같은 개인 민감정보(PSI)를 기억해 재생산함으로써 특히 임원·정치인·법관 등 유명인에게 큰 프라이버시 위험을 초래하는 문제를 다뤘다. 기존 대응책인 머신 언러닝은 필요 이상의 정보를 제거해 모델 유용성과 안전성을 저하시키고 공격에 취약하다는 한계가 있는데, 연구진이 제안한 'Whiteout'은 개인의 요청에 따라 정교하게 설계된 난독화 샘플로 해당 PSI를 덮어써 모델이 진짜 정보를 다시 내놓지 못하게 하는 실용적 도구다. OpenAI의 널리 쓰이는 모델을 포함해 다양한 크기와 제조사의 최신 LLM에서 평가한 결과 Whiteout은 표적 PSI 노출을 효과적으로 막으면서 모델 유용성과 안전성에는 거의 영향을 주지 않았고 기존 대안보다 우수했다. 잴브레이킹 같은 블랙박스 공격부터 재학습·양자화 같은 화이트박스 적응 공격까지 다양한 대응 공격에도 견고함을 입증했다.
- •LLM이 사랄·전홈번홈·주솤 륬 거인 민거정뿘(PSI)륬 기억해 장삁홈, 유홈인에거 홈히 위할
- •기안 덤은륨론이삁은 과용 삡제로 유위성·안전성 저하 뿐 공격 취약성 문제
- •정교흄 똄띹홈 샘해로 PSI륬 덤어쇩릈 Whiteout 제안, OpenAI 모륨 홈홈 렄흔홈 LLM에서 검즈
- •쟈뿘륨흈·장홈윈·안안퍈 륬 뿔똄착·홈은착 공격에렄 거고성 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mitigating Private Data Leakage in LLMs with Whiteout
- 1.개인정보 유출 방지 도구 'Whiteout' 발표, 언러닝 대신 난독화 샘플로 정보를 덮어쓰는 방식 채택
- 2.OpenAI의 주요 모델을 포함한 다양한 LLM에서 평가, 타깃 개인정보 노출을 효과적으로 차단
- 3.기존 언러닝 기법 대비 모델 유용성·안전성 저하가 미미하면서도 더 우수한 성능 기록
- 4.탈옥부터 재학습·양자화 같은 화이트박스 적응 공격까지 폭넓은 대응 공격에서 방어력 검증
왜 중요한가?
임원·정치인·판사 등 고위험 개인의 개인정보를 LLM이 그대로 토해내는 문제는 실제 서비스의 법적·윤리적 리스크인데, 기존 언러닝의 부작용(유틸리티 저하, 공격 취약성)을 피하는 대안을 제시해 실무 적용 가능성이 높다.
언급 프로젝트
본문 미리보기
arXiv:2610.02418v1 Announce Type: new Abstract: Modern large language models (LLMs) are trained on massive, largely unfiltered datasets, including content scraped from nearly every accessible website and user inputs. As a result, LLMs often memorize and reproduce personally sensitive information (PSI) such as birth dates, phone numbers, and home addresses. This leads to significant privacy risks, particularly for high-profile individuals such as executives, politicians, and judges. Existing mit
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

