ACP·A2A 같은 에이전트 상호작용 프로토콜은 LLM 기반 에이전트를 멀티 에이전트 협업으로 이끌었지만 새로운 보안 위협도 함께 들여왔다. A2A를 통해 원격 피어가 보낸 작업은 정당한 요청으로 취급되기 때문에 간접 프롬프트 주입의 자연스러운 통로가 되며, 기존 평가는 공격 성공률(ASR) 단일 지표에 의존해 LLM이 악성 콘텐츠를 인식해 막은 것인지 에이전트 계층의 방어가 차단한 것인지 구분하지 못한다. 연구팀은 간접 프롬프트 주입과 우회 회피를 결합한 공격 원리 'A2A-TIBA'를 제안해 삽입-명령-유출 단계를 거쳐 표적 에이전트가 콜백 상호작용 프로그램을 배치하도록 유도한 뒤 공격자가 이를 우회해 명령을 내리게 한다. 또한 ASR을 의미적 거부율·침해율·가로채기율·침투율로 세분화하는 GDA 측정법과, 방어를 봉투 포장·LLM 인식·에이전트 차단으로, 공격을 삽입 경로·프롬프트 최적화·실행 메커니즘으로 나누는 3계층 동형 공격-방어 모델(ELA-ITL)을 제안한다. 15개 조합과 1000건 데이터셋 실험에서 봉투 포장에 악성 프롬프트 라벨을 추가하면 LLM의 악성 콘텐츠 인식이 크게 향상됨을 확인했다.
- •A2A 등 에이전트 통신 프로토콜에서 원격 피어의 작업이 정당한 요청으로 취급돼 간접 프롬프트 주입의 통로가 될 수 있음을 지적.
- •기존 평가는 공격 성공률 단일 지표라 LLM 인식 차단과 에이전트 계층 차단을 구분하지 못한다는 한계를 제기.
- •삽입-명령-유출 단계로 콜백 프로그램을 배치시키는 공격 원리 A2A-TIBA와 세분화된 GDA 측정법, 3계층 동형 공격-방어 모델 ELA-ITL을 제안.
- •15개 조합과 1000건 데이터셋 실험에서 봉투 포장에 악성 프롬프트 라벨을 추가하면 LLM의 악성 콘텐츠 인식이 크게 향상됨을 확인.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From A2A Attacks to Envelope-Layer Defense: Red-Teaming Evaluation of LLM Agents and a Three-Layer Isomorphic Attack-Defense Model
- 1.A2A(에이전트간) 프로토콜의 원격 작업 요청을 악용하는 공격기법 'A2A-TIBA' 제안, 간접 프롬프트 주입과 우회기법 결합
- 2.기존 공격성공률(ASR) 단일지표 한계를 넘어 거부율·침해율·차단율·침투율 4단계로 세분화하는 'GDA 측정법' 도입
- 3.공격 진입 통로인 '엔벨로프 레이어'를 새 방어축으로 제시, 3계층 방어모델 'ELA-ITL' 구축
- 4.15개 에이전트-LLM 조합과 1000개 사례 실험에서 엔벨로프에 악성 라벨 추가 시 LLM 인식률이 크게 향상됨을 확인
왜 중요한가?
멀티에이전트 협업이 늘면서 A2A 같은 에이전트 간 통신 채널이 새로운 침투 경로가 될 수 있음을 보이고, 공격이 실패한 이유(인식 vs 차단)를 구분하는 세밀한 평가 체계를 제공해 방어 설계를 더 정교하게 만든다.
다중 에이전트 LLM 협업 시스템의 보안 취약성은 국내 AI 기술 발전에 있어 중요한 과제입니다. A2A 공격과 같은 새로운 위협에 대한 레드 팀 평가 및 3계층 방어 모델은, 한국 기업들이 안전하고 신뢰할 수 있는 다중 AI 에이전트 솔루션을 구축하는 데 필수적인 보안 프레임워크와 방안을 제공합니다.
본문 미리보기
arXiv:2610.00392v1 Announce Type: new Abstract: Agent interaction protocols such as ACP and A2A have moved LLM-based agents toward multi-agent collaboration, introducing new security threats. A task sent by a remote peer over A2A is treated as a legitimate request, providing a natural channel for indirect prompt injection. Existing agent security evaluations mostly rely on a single metric, the attack success rate (ASR), and cannot distinguish whether an attack failed because the LLM recognized
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

