검색증강생성(RAG) 시스템은 공격자가 조작된 문서를 검색 코퍼스에 삽입해 LLM을 잘못된 답으로 유도하는 코퍼스 오염 공격에 취약하다. 이 연구는 기존 단일 문서 공격과 달리 정답을 명시적으로 언급하고 이를 부정한 뒤 공격자가 유도하는 답을 지지하는 설명을 함께 제시하는 DenialRAG를 제안한다. 정답과 오염된 답을 같은 검색 구절 안에 동시에 배치해 생성기가 보는 맥락에 충돌을 직접 심는 방식이다. 4개 벤더의 8개 대상 LLM, 3개 개방형 질의응답 데이터셋, 5개 추론 시점 방어를 기준으로 기존 4개 공개 공격과 비교한 결과, 공격 효과는 모델에 크게 좌우됐으며 DenialRAG는 Mistral-7B 기반 세 데이터셋 모두에서 가장 높은 공격 성공률을 기록했다. 방어 기법들은 성공률을 의미 있게 낮췄지만 균일하지 않았고, 명시적 부정 요소가 가장 영향력 있는 구성요소로 확인됐다.
- •정답을 명시적으로 부정하고 오염된 답을 지지하는 설명을 같은 구절에 삽입하는 DenialRAG 제안
- •8개 LLM·3개 QA 데이터셋·5개 방어 기법 대상으로 기존 공격 4종과 비교 평가
- •Mistral-7B 기반 세 데이터셋 모두에서 최고 공격 성공률 달성, 다른 모델에서는 타 공격이 우세
- •방어 기법들이 성공률을 낮추지만 설정별로 잔여 성공률이 남아 불균일한 보호
- •명시적 부정(denial) 요소가 공격 효과에 가장 큰 영향을 미치는 구성요소로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
본문 미리보기
arXiv:2608.02678v1 Announce Type: new Abstract: Retrieval-augmented generation (RAG) systems are vulnerable to corpus poisoning: an attacker who inserts a crafted document into the retrieval corpus can steer the underlying large language model (LLM) toward an attacker-chosen wrong answer. Prior single-document attacks typically avoid explicitly naming and refuting the correct answer inside the poisoned passage. In this paper, we examine a complementary design and propose \emph{DenialRAG}, a sin
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



