연구진은 클린라벨(clean-label) 방식으로 학습 직후에는 잠복해 있다가 특정 데이터를 머신 언러닝으로 삭제하는 순간 활성화되는 백도어 공격 기법을 제안했다. 듀얼 제너레이터 기반 이중 최적화(bilevel optimization)로 샘플별 트리거와, 라벨을 바꾸지 않는 위장(camouflage) 샘플을 동시에 학습시켜 위장 샘플이 언러닝되면 억제가 풀리며 백도어가 발동하는 구조다. CIFAR-10과 ImageNet-10 실험에서 기존 백도어 기법보다 언러닝 이전 공격 성공률은 낮추면서 언러닝 이후 활성화율은 더 높게 유지했다. 데이터 삭제(잊힐 권리) 요청이 오히려 공격의 방아쇠가 될 수 있음을 보여준 결과로, 머신러닝 서비스의 언러닝 절차 자체를 보안 위협 벡터로 재검토할 필요성을 제기한다.
- •클린라벨 백도어가 학습 후 비활성 상태를 유지하다 머신 언러닝 시점에 활성화됨
- •듀얼 제너레이터·이중 최적화로 트리거-타겟 연관과 위장 샘플의 억제 효과를 동시에 학습
- •CIFAR-10·ImageNet-10에서 기존 백도어 대비 언러닝 전 낮은 공격 성공률, 언러닝 후 높은 활성화율 달성
- •데이터 삭제(언러닝) 요청 자체가 새로운 공격 벡터가 될 수 있음을 실증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benign on Label, Malicious by Design: Clean-Label Dormant-to-Activated Backdoor via Machine Unlearning with Removable Camouflage
본문 미리보기
arXiv:2607.27936v1 Announce Type: new Abstract: Existing backdoor attacks often become effective immediately after backdoor implantation and may therefore be exposed before exploitation. Machine unlearning activated dormant backdoors mitigate such behavioral exposure by remaining inactive after training and becoming effective only after selected training records are unlearned. However, existing methods struggle to simultaneously achieve a low pre-unlearning attack success rate and strong post-u
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:06AI 초안



