이 논문은 다중 턴에 걸쳐 전략을 계속 바꾸는 정교한 적대적 공격에 기존의 반응적(reactive) 방어가 취약하다는 문제를 지적하며, LLM을 보호하는 능동적 방어 프레임워크를 제안한다. 협력적 다중 에이전트 구조에서 전문화된 에이전트들이 응답 속도를 조절해 공격 비용을 높이는 지연 전략, 공격자를 비효율적 전략으로 유도하는 전략적 모호 응답, 상호작용 로그의 포렌식 분석을 통한 공격 패턴 파악 등 상호 보완적 방어를 수행하며, 적응형 메커니즘이 위협 고조에 따라 방어 전략을 동적으로 조정한다. 연구진은 8가지 공격 유형에 걸친 5200개의 적대적 샘플로 구성된 EMRA 데이터셋을 새로 구축해 평가에 활용했다. 여러 LLM 백본에 대한 실험 결과, 제안된 프레임워크는 최신 베이스라인 대비 공격 성공률(ASR)을 평균 69% 낮췄고, 기만적 참여(DR)는 최강 베이스라인의 6배 이상을 달성했으며 공격자의 토큰 소모량도 평균 198.83% 늘렸다.
- •다중 턴에 걸쳐 전략을 바꾸는 진화형 공격에 대응하는 능동적·협력적 다중 에이전트 방어 제안
- •응답 지연, 전략적 모호 응답, 상호작용 로그 포렌식 분석 등 상호 보완 전략 결합
- •8개 공격 유형·5200개 샘플의 EMRA 데이터셋 신규 구축
- •여러 LLM 백본에서 공격 성공률(ASR) 평균 69% 감소
- •기만적 참여(DR) 최강 베이스라인 대비 6배 이상, 공격자 토큰 소모량 평균 198.83% 증가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks
- 1.반응적 방어의 한계를 넘어 다턴 공격에 교란·오도·적응을 결합한 선제적 방어 프레임워크 제안
- 2.응답 속도 조절로 공격 비용 증가, 모호한 출력로 공격자 오도, 로그 포렌식 분석을 전문 에이전트가 분담
- 3.8개 공격 유형 5,200개 샘플의 EMRA 데이터셋에서 ASR을 평균 69% 감소
- 4.기만적 교전 유지로 최강 베이스라인 대비 DR 6배 이상, 공격자 토큰 소모 198.83% 증가
왜 중요한가?
LLM 방어가 대부분 사후 반응형이라 전략을 계속 바꾸는 다턴 공격에 취약했는데, CoopGuard는 협력형 멀티에이전트로 공격 비용을 능동적으로 높이는 선제 방어를 제시했다. 유해 출력 억제를 넘어 공격자 자원을 소모시키는 접근은 LLM 안전 방어 설계에 새로운 방향을 준다.
본문 미리보기
arXiv:2608.00134v1 Announce Type: new Abstract: As LLMs become increasingly integrated into complex applications, their vulnerability to adversarial attacks has raised significant concerns. However, existing defenses remain reactive in nature. This limitation makes it difficult for them to counter sophisticated threats, as adversaries continuously adjust their strategies across multi-turn interactions. In this paper, we present a proactive defense framework for securing LLMs against evolving mu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:35AI 초안

