도구 통합 에이전트가 외부 도구의 진실성을 가정한 데서 비롯되는 보안 격차(Trust Gap)를 지적한다. 저자들은 도구 출력을 적대자가 조작해 에이전트를 속이는 위협 모형을 적대적 환경 주입(AEI)으로 정식화하고, MCP 호환 평가 하니스 POTEMKIN을 제안한다. 두 직교 공격 표면으로 검색 결과를 오염시켜 신념 표류를 유도하는 'The Illusion'(폭 공격)과 구조적 함정으로 정책 붕괴(무한 루프)를 유발하는 'The Maze'(깊이 공격)를 정의한다. 5개 프런티어 에이전트의 11,000+ 실행 결과, 한쪽에 강하면 다른 쪽이 약한 견고성 격차가 드러났다.
- •도구 출력 대한 회의 결여를 평가하는 'Trust Gap' 개념 제시
- •AEI(적대적 환경 주입)를 위협 모델로 정의하고 POTEMKIN 하니스 공개
- •Illusion(검색 오염)·Maze(구조 함정) 두 종류 시나리오로 취약점 시험
- •5개 프런티어 에이전트가 두 공격에 광범위한 견고성 격차 노출
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How Adversarial Environments Mislead Agentic AI?
본문 미리보기
arXiv:2604.18874v1 Announce Type: new Abstract: Tool-integrated agents are deployed on the premise that external tools ground their outputs in reality. Yet this very reliance creates a critical attack surface. Current evaluations benchmark capability in benign settings, asking "can the agent use tools correctly" but never "what if the tools lie". We identify this Trust Gap: agents are evaluated for performance, not for skepticism. We formalize this vulnerability as Adversarial Environmental Inj
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

