OpenEvoShield는 LLM 기반 멀티에이전트 시스템(LLM-MAS)에서 에이전트 간 통신으로 주입되는 악성 지시를 지속적으로 방어하는 공진화 프레임워크다. 공격 전략 진화와 정상 에이전트 행동 드리프트라는 이중 비정상성에 대응해, 비대칭 학습률 컨트롤러(M1), 느린 속도의 정상 경계 갱신기(M2), EWC 정규화 정책 앙상블(M3), 노드·서브그래프·그래프 수준 증거를 융합하는 에너지 기반 다중 granularity 탐지기(M4)를 결합했다. 5개 벤치마크와 4가지 MAS 토폴로지에서 100 라운드 배포 실험 결과, 정적·연속학습 기준선을 모두 앞서며 낮은 오탐률로 미지의 공격 대부분을 탐지했다. 폐쇄 세계 가정에 묶인 기존 방어의 한계를 넘어, 실제 운영 환경의 개방형 위협에 대응하는 방향을 제시한다.
- •공격 진화와 정상 행동 드리프트라는 이중 비정상성을 명시적으로 다루는 LLM-MAS 연속 방어 프레임워크
- •빠른 공격측·느린 정상측 학습률을 분리하는 비대칭 레이트 컨트롤러와 EWC 정규화로 파국적 망각 방지
- •노드·서브그래프·그래프 수준 증거를 융합하는 에너지 기반 탐지기로 신종 공격을 OOD로 분류
- •5개 벤치마크·4개 토폴로지·100 라운드 실험에서 정적·연속학습 기준선 모두 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks
- 1.LLM 멀티에이전트 시스템의 진화형 공격에 대응하는 공진화 지속 방어 OpenEvoShield 제안
- 2.공격측 빠른 학습률과 정상측 느린 학습률을 분리하는 비대칭 속도 제어기 등 4개 모듈 구성
- 3.노드·서브그래프·그래프 수준 증거를 융합하는 에너지 기반 탐지기로 신종 공격을 OOD로 분류
- 4.100라운드 배포·5개 벤치마크·4개 토폴로지에서 미확인 공격 대부분 탐지, 오탐율 낮게 유지
왜 중요한가?
기존 방어가 학습 범위를 벗어난 분포 변화에 급격히 무너지는 폐쇄 세계 가정을 깨고, 공격 진화와 정상 행동 드리프트가 동시에 일어나는 개방 환경을 처음부터 상정한 설계다. 에이전트 간 통신을 통한 악성 지시 전파가 현실 위협이 되는 만큼 시의성이 크다.
언급 프로젝트
본문 미리보기
arXiv:2607.19351v1 Announce Type: new Abstract: LLM-based multi-agent systems (LLM-MAS) are increasingly deployed in safety-critical applications, where adversaries inject malicious instructions through inter-agent communication to propagate harmful behaviors. Unlike static threats, these attacks are doubly dynamic: adversaries refine injection strategies against deployed defenses while normal-agent behavior drifts with system expansion. Existing defenses treat deployment as a closed-world prob
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

