이 연구는 간접 프롬프트 인젝션을 환경·사용자 작업·주입 작업이 만드는 공격 표면 위에서 이루어지는 '테스트 타임 탐색' 문제로 재정식화한다. 저자들은 환경 정찰, 공격 전략에 대한 구조화된 추론, 피해 에이전트의 피드백을 활용한 적응적 평가를 수행하는 전용 탐색 하니스를 갖춘 에이전트형 공격자를 도입했다. 다양한 과제에서 공격자의 테스트 타임 연산량을 늘릴수록 취약점 발견과 악용 성공률이 높아졌으며, 명시적인 전략 관리가 중복 탐색을 줄이고 예산이 커져도 성능 향상을 지속시키는 데 중요함을 확인했다. 이는 에이전트 보안 평가가 공격 성공 여부를 예산과 무관한 피해자 속성으로만 볼 게 아니라, 공격자의 탐색 절차와 연산 예산까지 함께 특성화해야 함을 시사한다.
- •간접 프롬프트 인젝션을 공격 표면 위 테스트 타임 탐색 문제로 재정식화
- •정찰·전략 추론·피해자 피드백 기반 적응 평가를 수행하는 에이전트형 공격자 도입
- •공격자의 테스트 타임 연산량 증가가 취약점 발견·악용 성공률을 향상시킴
- •명시적 전략 관리가 중복 탐색 방지와 대규모 예산에서의 성능 유지에 핵심적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Rethinking Indirect Prompt Injection as a Test-Time Search Problem
- 1.간접 프롬프트 인젠션을 테스트 타임 탐색(search) 문제로 재정의한 에이전트형 공격자 프레임워크 제안
- 2.환경 정찰, 공격전략 추론, 피해 에이전트 피드백 기반 적응 평가를 수행하는 전용 탐색 하네스 도입
- 3.공격자의 테스트 타임 연산량을 늘릴수록 취약점 발견·악용 성공률이 높아짐을 확인
왜 중요한가?
툴을 사용하는 LLM 에이전트의 보안 평가에서 공격자의 탐색 전략과 연산 예산까지 고려해야 한다는 점을 제시해, 에이전트 보안 벤치마크 설계 방식에 직접적인 함의를 준다.
본문 미리보기
arXiv:2609.04495v1 Announce Type: new Abstract: We formulate indirect prompt injection as a test-time search over a task-dependent attack surface induced by the environment, user task, and injection task. To operationalize this formulation, we introduce an agentic attacker with a dedicated search harness that performs environment reconnaissance, structured reasoning over attack strategies, and adaptive evaluation using victim-agent feedback. Across heterogeneous tasks, we find that increasing a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
