멀티에이전트 LLM 시스템을 겨냥한 프롬프트 인젝션 위협을 체계화한 연구가 발표됐다. 연구진은 직접 인젝션, 도구 출력을 통한 간접 인젝션, 에이전트 간 메시지 인젝션, 오케스트레이터 조작을 통한 연쇄 인젝션 등 4개 범주 14개 공격 벡터를 정의했다. 6개 에이전트로 구성된 실제 서비스 수준 시스템에서 테스트한 결과, 시스템 프롬프트 방어에도 불구하고 에이전트의 67%가 최소 하나의 권한 위반에 취약했고 간접 인젝션은 43%의 시도에서 성공했다. 메시지 서명, 경계 지점 입출력 검증, 역할별 권한 제한, 통신 이상 탐지 등 4가지 아키텍처 방어를 적용하자 전체 공격 성공률이 31.2%에서 4.2%로 낮아졌다. 단일 모델 중심 방어를 멀티에이전트 구조 전체로 확장해야 함을 보여주는 결과다.
- •멀티에이전트 시스템 특유의 4개 범주·14개 프롬프트 인젝션 공격 벡터를 체계화
- •6개 에이전트 시스템에서 67%가 최소 1개 권한 위반에 취약, 간접 인젝션 성공률 43%
- •메시지 서명·경계 검증·권한 제한·이상 탐지 4중 방어로 공격 성공률 31.2%→4.2%
- •권한 제한 도구 접근 적용 시 권한 상승 공격은 완전히 차단
- •단일 모델용 방어가 멀티에이전트 환경에선 불충분함을 실증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Single-Model Injection: A Threat Model and Defense Architecture for Prompt Injection in Multi-Agent Systems
- 1.멀티에이전트 프롬프트 인젝션 위협모델을 14개 벡터·4개 범주로 체계화
- 2.6-에이전트 시스템에서 67%가 스코프 위반에 취약, 간접 인젝션 성공률 43%
- 3.메시지 서명·경계 정제·역할별 권한분리·이상탐지 등 4가지 방어책 도입
- 4.네 방어책 결합으로 전체 인젝션 성공률을 31.2%에서 4.2%로 절감
왜 중요한가?
단일 챗봇 중심이던 기존 연구와 달리 에이전트 간 메시지 전달·도구 공유·신뢰 전파라는 멀티에이전트 고유 공격면을 정량화하고 실배포 가능한 방어책까지 검증했다.
본문 미리보기
arXiv:2609.22949v1 Announce Type: new Abstract: Existing prompt injection research focuses on single-model chatbot scenarios, where an attacker manipulates one LLM through crafted input. Multi-agent systems amplify this threat through three mechanisms absent from single-model settings: inter-agent message passing creates injection channels invisible to perimeter defenses, shared tool access enables privilege escalation across agent boundaries, and trust propagation allows a compromised agent to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

