연구진이 서드파티 모델에 백도어를 심은 공급망 공격이 개발자의 지도 미세조정(SFT)과 강화학습(RL)을 거치고도 살아남는지 분석했다. 소프트웨어 엔지니어링 에이전트를 대상으로 실험한 결과, 일반적인 SFT는 공격 성공률을 크게 낮췄지만 이후 진행되는 과업 수준 강화학습은 잔존 백도어 행동을 유지하거나 오히려 공격 성공률을 높이는 경우가 많았다. 연구진은 이 현상을 바탕으로 출시 전 모델을 미리 조정해 지속성을 높이는 기법 'PersistBD'를 제안했으며, Qwen2.5-Coder-7B 모델에서 SFT 후 공격 성공률을 20%에서 74%로, SFT+RL 후에는 20%에서 76%로 끌어올리면서도 정상 과업 성능은 유지했다. 이는 AI 개발자에게 상속된 백도어를 탐지·완화할 더 강력한 기술이 필요함을 보여준다.
- •서드파티 모델 백도어가 개발자의 SFT·RL 과정을 거친 뒤에도 살아남는지 실증 분석
- •일반 SFT는 공격 성공률 크게 낮추지만, 이후 RL은 잔존 백도어를 유지·강화하는 경우 많음
- •지속성을 높이는 공격 기법 'PersistBD' 제안
- •Qwen2.5-Coder-7B서 공격 성공률 SFT 후 20%→74%, SFT+RL 후 20%→76%로 급등
- •정상 과업 성능은 유지되면서 공격만 강화돼, AI 공급망 백도어 탐지·완화 기술 필요성 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training
- 1.서드파티 모델에 심어진 백도어가 개발자의 SFT·RL 후에도 살아남는지 분석
- 2.선의의 SFT는 공격성공률을 낮추지만 이후 RL 단계는 잔존 백도어를 보존·강화시킴을 발견
- 3.개발자 분배 전 백도어를 미리 보강하는 기법 PersistBD 제안
- 4.Qwen2.5-Coder-7B에서 SFT 후 20%→74%, SFT-RL 후 20%→76%로 공격성공률 상승, 정상성능은 유지
왜 중요한가?
소프트웨어 엔지니어링 에이전트를 만들 때 서드파티 모델을 가져다 미세조정하는 관행이 흔한데, 공격자가 배포 전 모델을 조작해두면 개발자의 선의의 후속 학습으로도 백도어가 제거되지 않고 오히려 강화될 수 있음을 보여 AI 공급망 검증의 필요성을 부각한다.
언급 프로젝트
LLM 에이전트 개발 시 서드파티 모델의 활용이 보편화되는 국내 상황에서, 모델 공급망을 통한 백도어 공격 위협은 심각한 보안 문제를 야기할 수 있습니다. 특히 악성 백도어가 일반적인 후속 훈련 이후에도 지속된다는 점은 국내 기업들이 AI 에이전트 도입 시 모델의 출처와 무결성 검증에 더 큰 노력을 기울여야 함을 시사합니다. 이는 AI 기반 서비스의 신뢰성을 확보하고 잠재적 피해를 예방하는 데 필수적인 정보입니다.
본문 미리보기
arXiv:2610.07510v1 Announce Type: new Abstract: Developers can build LLM agents by adapting third-party models through benign post-training. We study a supply-chain threat in which an attacker supplies a model with a backdoor: hidden behavior that produces malicious outputs when a particular input pattern appears. Focusing on software-engineering agents, we ask whether such backdoors survive the developer's supervised fine-tuning (SFT) and subsequent task-level reinforcement learning (RL). We o
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

