이 논문은 도구 사용 에이전트가 신뢰 수준이 다른 외부 데이터를 받으면서도 각 정보의 출처를 확인하지 못해 발생하는 '상태 오염 공격'을 다룬다. 공격자가 통제한 콘텐츠가 자신의 정보 권한을 넘어서는 환경 주장을 함으로써 에이전트의 인식된 환경을 오염시키고, 결과적으로 가드레일에는 정당해 보이는 행동을 유도할 수 있다. 저자들은 의미적 사전 지식과 출처 계보를 함께 심사하는 PIPES 기법을 제안하고, 스키마가 안정적일 때는 정적 필드 계약을, 개방형 콘텐츠는 이전 궤적과 신뢰 출처 메타데이터를 기준으로 심사한다. Gemma 4 31B IT를 대상으로 VitaBench·AgentDyn 6개 분할에서 실험한 결과 평균 공격 성공률을 84.7%에서 2.3%로 낮추면서도 정상 작업 성능은 92.5%로 유지했다(방어 미적용 시 90.6%).
- •출처 미상 외부 데이터로 에이전트 인식을 오염시키는 '상태 오염 공격' 문제 제기
- •의미적 사전 지식과 출처 계보를 함께 심사하는 PIPES 방어 기법 제안
- •Gemma 4 31B IT 대상 실험에서 평균 공격 성공률 84.7%→2.3%로 감소
- •정상 작업 성능은 방어 적용 시 92.5%로 오히려 미적용(90.6%)보다 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PIPES: Securing Agent Perception with Provenance and Priors
- 1.도구사용 에이전트를 겨냥한 '상태 오염' 공격에 대응하는 방어기법 'PIPES' 제안
- 2.응답 단위별 출처(provenance)와 의미적 사전 기대치를 함께 심사해 위반 시 제거·경고·차단·에스컬레이션
- 3.VitaBench·AgentDyn 6개 데이터셋, Gemma 4 31B IT 에이전트 실험에서 공격성공률 84.7%→2.3%로 감소
- 4.정상작업 유용성은 92.5%(PIPES 적용)로 무방비 상태(90.6%) 대비 오히려 유지·향상
왜 중요한가?
도구 응답의 출처를 검증하지 않는 에이전트가 조작된 외부 콘텐츠에 쉽게 속아 가드레일을 우회당할 수 있음을 보여주고, 공격 성공률을 대폭 낮추면서도 정상 성능은 유지하는 실용적 방어책을 제시한다.
본문 미리보기
arXiv:2608.12789v1 Announce Type: new Abstract: Tool-using agents consume external data from sources with different levels of trust, yet tool responses rarely identify who produced each component or what it should convey. We show that this gap enables state-corruption attacks, in which attacker-controlled content makes environmental claims beyond the informational authority of its response component and corrupts the agent's perceived environment, making the resulting action appear justified to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

