이 연구는 검색증강생성(RAG)에 악성 문서를 주입하는 오염 공격이 오히려 perplexity를 낮춰 기존의 불확실성 기반 탐지를 무력화한다는 사실을 밝혔다. 공격받은 생성 결과의 내부 어텐션을 분석한 결과, 정상 생성에서는 어텐션이 분산되는 반면 공격 시에는 오염된 문서에 어텐션이 집중되며 엔트로피가 감소하는 '어텐션 붕괴(Attention Collapse)' 현상을 발견했다. 이를 바탕으로 어텐션 동역학을 모니터링해 공격받은 생성을 탐지하는 경량 프레임워크 D-SCAN을 제안했으며, 여러 공격 벤치마크에서 효과를 입증했다. D-SCAN은 공격이 최종 답변을 바꾸지 못한 경우에도 탐지할 수 있어, 출력 신호에만 의존하던 기존 탐지 방식의 사각지대를 보완한다.
- •RAG 오염 공격이 perplexity를 낮춰 기존 탐지를 무력화함을 발견
- •공격 시 어텐션이 오염 문서에 집중되는 '어텐션 붕괴' 현상 규명
- •어텐션 동역학 기반 경량 탐지 프레임워크 D-SCAN 제안
- •최종 답변이 바뀌지 않은 공격도 탐지 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse
본문 미리보기
arXiv:2608.06947v1 Announce Type: new Abstract: Retrieval-augmented generation (RAG) is indispensable for enhancing large language models. However, RAGs are increasingly susceptible to poisoning attacks, in which adversarial documents are injected to manipulate generator outputs. Previous methods rely on output-side signals such as perplexity and consistency checks to detect such attacks. Nevertheless, our analysis reveals that deliberate attacks often induce false confidence, where poisoned ou
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



