BASIS는 프롬프트 인젝션 탐지 시 무조건 응답을 거부하던 기존 방식이 실제로는 견고한 지시문이면 처리 가능한 입력까지 과잉 거부한다는 문제를 해결하는 방어 기법이다. 어텐션 경쟁 비율(ρ)을 특징으로 활용해 존재 여부를 판단하는 프로브와 침해 여부를 판단하는 프로브 두 개의 희소 선형 프로브를 학습시키고, 추가 LLM 추론 없이 계단식 게이팅으로 방어를 결정한다. 인젝션 존재 탐지, 샘플별 침해 예측, 지시문 견고성 평가 3단계로 구성돼 실제로 모델이 침해될 경우에만 거부하므로 견고한 지시문에 대한 과잉 거부를 피한다. 4개 과제와 6개 오픈소스 LLM 실험에서 거의 완벽한 인젝션 탐지 성능을 유지하면서도 안전한 공격 샘플에 대한 과잉 거부를 크게 줄였다.
- •인젝션 탐지 시 무조건 거부하던 기존 방식의 과잉거부 문제를 해결하는 BASIS 방어 기법 제안
- •어텐션 경쟁비율(ρ) 기반 희소 선형 프로브 두 개(존재·침해 판단)로 추가 LLM 추론 없이 결정
- •인젝션 탐지-침해 예측-견고성 평가 3단계로 실제 침해 시에만 거부하는 계단식 게이팅 적용
- •6개 오픈소스 LLM 실험에서 탐지 성능 유지하면서 과잉거부를 크게 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes
본문 미리보기
arXiv:2608.08027v1 Announce Type: new Abstract: Prompt injection is a critical security threat in large language model (LLM) applications, where attackers hijack model behavior by embedding malicious instructions in user or external data. Existing detection methods only detect the presence of injection and refuse to respond upon detection, overlooking the fact that for many modern aligned models, well-crafted instructions can resist most injection attacks. This means that the injection robustne
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



