이 논문은 파인튜닝 과정에서 심어진 백도어가 트리거 조건이 테스트 중 발현되지 않으면 탐지되지 않을 수 있다는 문제를 다루며, 알려진 백도어를 일부러 심은 뒤(방어적 오염) 이를 언러닝해 원래의 미지 백도어까지 함께 제거하는 '오염 제거(decontamination)' 전략의 동역학을 연구한다. AgentDyn 상의 도구 호출 에이전트 대상 115회 실험 결과, 방어적 오염만으로 원래 백도어의 약 56%가 제거됐고, 후속 언러닝은 남은 백도어의 거의 전부를 제거해 트리거 인식과 악성 실행이 행동적으로 분리 가능함을 확인했다. 최대 4개 백도어를 동시 설치하면 저항성이 높아지지만(약 36% 제거) 그중 하나만 알아도 언러닝 시 공존 백도어의 87%(52/60)가 함께 제거됐다. 다만 언러닝 후에도 모델 중간 레이어에는 원래 트리거 인식의 흔적이 남아 있었다.
- •AgentDyn 도구 호출 에이전트 대상 115회 실험, 방어적 오염만으로 백도어 약 56% 제거
- •후속 언러닝으로 생존 백도어 거의 전부 제거, 트리거 인식과 악성실행은 행동적으로 분리 가능
- •최대 4개 백도어 동시 설치 시 저항성 상승(약 36% 제거)하나 하나만 알아도 공존 백도어 87% 제거
- •언러닝 후에도 중간 레이어에는 원래 트리거 인식 흔적이 잔존
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Backdoor Decontamination Dynamics in LLM Agents
본문 미리보기
arXiv:2608.11295v1 Announce Type: new Abstract: Open-weight LLM agents are vulnerable to backdoors installed during fine-tuning, which may be undetectable if the trigger conditions are never met during testing. Assuming defenders do not know the existing trigger, they cannot unlearn it directly. One decontamination strategy is to install a known backdoor (defensive poisoning) then to unlearn it, hoping that the original unknown backdoor is removed as a side effect. However, this procedure has u
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



