LoRAScan은 신뢰할 수 없는 LoRA 어댑터에 숨겨진 트리거가 포함되면 모델이 유해 콘텐츠나 악성 코드를 생성하는 공급망 위협에 대응하는, 어댑터 파라미터를 수정하지 않고 추론 시점에 트리거 입력을 탐지·거부하는 최초의 어댑터 인지형 방어 기법이다. 기존 어댑터 무관 방어는 어댑터를 베이스 모델과 병합해 백도어 신호를 희석시키고, 기존 어댑터 인지 방법은 어댑터 자체를 안전하게 쓰는 방법을 다루지 못했다. LoRAScan은 약 5%에 불과한 소수의 LoRA 삽입 지점이 정상 입력에서는 안정적이다가 트리거가 있으면 다운프로젝션 활성화에서 뾰족한 스파이크를 보인다는 점에 착안해, 배포 전 이런 저분산 삽입 지점을 식별하고 추론 중 모니터링한다. 표준 LLM 백도어 벤치마크에서 정상 입력 오류율은 낮게 유지하면서 악성 입력의 약 98.49%를 거부해 기존 방어들을 능가했다.
- •어덩터 파라미터 수정 없이 추론 시점에 트리거 입력을 탐지하는 최초 기법
- •약 5%의 저분산 LoRA 삽입 지점에서 트리거 시 활성화 스파이크 발견
- •표준 백도어 벤치마크에서 악성 입력 약 98.49% 거부
- •기존 어덩터 무관·어덩터 인지 방어의 한계를 동시에 보완
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes
본문 미리보기
arXiv:2608.06795v1 Announce Type: new Abstract: Low-rank adaptation (LoRA) enables efficient specialization and distribution of large language models through compact adapters. However, untrusted adapters introduce a supply-chain threat: a backdoored adapter can cause a model to generate harmful content, malicious code, political propaganda, or covert advertisements when an input contains a hidden trigger. Adapter-agnostic defenses merge the adapter with the base model, which dilutes backdoor si
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



