연구진이 RAG(검색증강생성) 시스템의 지식 오염 공격에 맞서는 비잔틴 내결함성 협업 RAG 프레임워크 SecureCollaRAG를 제안했다. RAG는 LLM의 환각 문제를 일부 해결하지만, 공격자가 검색 문서를 오염시켜 출력을 조작하는 새로운 취약점을 만든다는 문제의식에서 출발했다. 다중 소스 지식 검증 메커니즘을 통해 에이전트 시스템이 동적 GNN 기반 신뢰도 점수로 문서 출처를 안전하게 검증함으로써, 핵심 도메인 지식의 무결성을 유지하면서도 은밀한 지식 오염 공격을 효과적으로 차단한다. 광범위한 실험과 형식적 분석을 통해 비독립동일분포(non-IID) 데이터 환경에서도 공격자에 대한 견고성이 유지됨을 입증했다. 이 연구는 ACM 웹 컨퍼런스 2026에 게재됐으며, 멀티에이전트 RAG 시스템의 신뢰성 있는 지식 공유를 위한 실용적 방어책을 제시한다.
- •RAG 시스템의 지식 오염 공격에 대응하는 비잔틴 내결함성 협업 프레임워크 SecureCollaRAG를 제안했다
- •동적 GNN 기반 신뢰도 점수로 문서 출처를 검증하는 다중 소스 지식 검증 메커니즘을 사용한다
- •비독립동일분포(non-IID) 데이터 환경에서도 공격자에 대한 견고성을 형식적으로 입증했다
- •ACM 웹 컴퍼런스 2026에 게재되며 멀티에이전트 RAG의 신뢰성 확보 방향을 제시한다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework
본문 미리보기
arXiv:2608.04366v1 Announce Type: new Abstract: While retrieval-augmented generation systems partially address the hallucination issues in large language models, it also introduces new vulnerabilities to knowledge corruption attacks. Adversaries exploit these vulnerabilities by poisoning documents provided by RAG system to manipulate LLM outputs. To counter this threat, we propose SecureCollaRAG, a Byzantine-tolerant collaborative RAG framework leveraging Multi-source Knowledge Validation Mecha
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



