학습 과정에서 LLM에 심어진 백도어를 재학습 없이 제거하는 NEEDLE 기법을 제안했다. 기존 방법은 트리거를 없애는 과정에서 정상 입력에 대한 출력 분포까지 바꿔 성능과 안전성을 훼손했지만, NEEDLE은 활성화 벡터로 백도어 방향과 거부(refusal) 서브스페이스를 추정한 뒤 순차적 가중치 직교화로 백도어만 억제하고 거부 행동은 보존한다. 깨끗한 참조 모델이나 원본 오염 데이터가 전혀 필요 없으며, 여러 모델과 공격 유형에서 코드 삽입 공격을 0%의 성공률로 막는 등 기존 방어 기법 중 가장 낮은 평균 공격 성공률과 가장 적은 성능 변화를 기록했다. 참조 데이터 없이도 효과적인 백도어 제거가 가능함을 보여 LLM 보안 운영에 실용적 대안을 제시한다.
- •학습 없이 활성화 벡터만으로 백도어 방향과 거부 서브스페이스를 추정하는 NEEDLE 기법 제안
- •순차적 가중치 직교화로 백도어를 억제하면서 모델의 거부(안전성) 행동은 그대로 유지
- •깨끗한 참조 모델이나 원본 오염 데이터 없이도 작동하는 training-free 방어 기법
- •코드 삽입 공격에서 공격 성공률 0%를 기록하며 평가된 방어 기법 중 가장 낮은 평균 ASR 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation
- 1.트리거 식별 후 재학습 없이 백도어를 제거하는 기법 'NEEDLE' 제안
- 2.활성화 벡터로 백도어 방향과 거부 서브스페이스를 추정해 가중치를 직교화
- 3.코드 인젝션 공격 포함 평가에서 공격성공률(ASR) 0%, 최저 평균 ASR 달성
- 4.클린 참조모델·오염데이터 불필요, KL발산 최저로 성능·안전성 손상 최소화
왜 중요한가?
기존 백도어 제거 기법은 정상 입력에 대한 출력 분포까지 틀어뜨려 성능 저하를 유발했는데, NEEDLE은 추가 학습이나 참조 데이터 없이도 백도어만 선택적으로 제거해 실무 적용 비용을 크게 낮춘다.
언급 프로젝트
거대 언어 모델(LLM)에 삽입된 백도어 공격은 국내에서 개발 및 활용되는 LLM의 신뢰성을 심각하게 저해할 수 있습니다. 이 기술은 모델 성능 저하 없이 백도어를 효과적으로 제거하는 방안을 제시하여, 한국 기업과 연구자들이 더욱 안전하고 윤리적인 LLM을 개발하고 배포하는 데 중요한 보안 솔루션이 될 것입니다.
본문 미리보기
arXiv:2610.00348v1 Announce Type: new Abstract: Backdoor attacks can be implanted in Large Language Models (LLMs) during training, causing unwanted behaviour when a trigger appears in the input. Existing backdoor defences for LLMs attempt to remove the backdoor but inadvertently shift the model's output distribution to benign prompts, which can result in degraded model performance and safety. We propose NEEDLE, a training-free method for targeted backdoor removal. Once a trigger has been identi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

