이 논문은 공개 저장소에 업로드된 파인튜닝 LLM의 백도어 여부를 학습 데이터나 트리거 문구 없이 점검할 방법이 마땅치 않다는 문제를 다루며, 모델 자신의 출력을 다음 입력으로 되먹여 텍스트가 원래 프롬프트에서 벗어나 파인튜닝 데이터 방향으로 표류하게 만드는 블랙박스 탐지 기법 '셀프피딩(self-feeding)'을 제안한다. 11가지 공격 유형으로 백도어를 심은 6개 오픈웨이트 LLM(30억~150억 파라미터)에 20개의 평범한 시작 프롬프트와 최대 10단계 체인으로 실험한 결과, 셀프피딩은 92.0%의 통합 정밀도로 6개 중 5개 모델에서 백도어를 찾아낸 반면, 동일 프롬프트 반복 기준선은 120개 프롬프트-모델 조합 중 단 1개에서만 성공했다. 체인을 4단계로 줄이면 질의 수를 60% 절감하면서도 모델 단위 탐지 정밀도 100%를 유지했다.
- •모델 자신의 출력을 다음 입력으로 되먹이는 블랙박스 백도어 탐지 기법 '셀프피딩' 제안
- •6개 오픈웨이트 LLM(30억~150억 파라미터), 11가지 공격 유형 대상 실험
- •셀프피딩 92.0% 정밀도로 6개 중 5개 모델에서 백도어 탐지, 동일프롬프트 기준선은 120개 중 1개만 성공
- •체인 4단계로 축소 시 질의 60% 절감하면서도 모델 단위 탐지 정밀도 100% 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs
본문 미리보기
arXiv:2608.11348v1 Announce Type: new Abstract: Anyone can upload a fine-tuned large language model (LLM) to a public repository and claim it is safe. A backdoored model behaves normally on ordinary inputs until a hidden trigger fires, and a user with no training data, clean reference weights, or the trigger phrase has no clear way to check the model before using it. We introduce and empirically evaluate self-feeding, a black-box test method that feeds a model's own output back as its next inpu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



