SAVOR는 반복 질의로 공격을 다듬는 기존 적응형 간접 프롬프트 인젝션(IPI) 공격과 달리, 미지의 표적 에이전트와 단 한 번만 상호작용 가능한 현실적 상황을 가정해 공격 적응을 테스트 시점 반복 대신 오프라인 전략 증류로 옮긴 기법이다. 서로 다른 학습 환경에서 수집한 성공·실패 궤적에 대해 결과조건부 성찰을 수행하고, 맥락조건부 후보 전략을 검증한 뒤 재사용 가능한 전략 메모리로 통합한다. 테스트 시점에는 고정된 메모리가 표적 에이전트 질의 1회, 피드백 없이 단일 페이로드 생성을 안내한다. 두 개 벤치마크와 세 개 피해 모델에서 여섯 개 설정 모두 최고 평균 공격성공률을 달성했으며, 공격자 도구를 배제한 Agent Security Bench에서 기존 최강 공격보다 2.5~11.8점, 전략학습 없는 동일 주입 채널보다 23.1점 앞섰고, 공격 목표를 배제하고 도구 상호작용·실행 영수증으로 검증하는 자체 벤치마크 OpenClaw-IPI에서는 28.6점 앞섰다. 한 방어 체계에서 학습한 메모리는 다른 방어 체계로도 전이됐다.
- •단일 상호작용만으로 공격하는 오프라인 전략증류 기법 SAVOR 제안
- •결과조건부 성찰로 성공·실패 굤적을 재사용 가능한 전략 메모리로 통합
- •6개 설정 모두에서 최고 평균 공격성공률 달성, 기존 최강 공격 대비 2.5~11.8점 앞서
- •OpenClaw-IPI 자체 벤치마크에서 28.6점 앞선, 다른 방어체계로도 전략 전이 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
본문 미리보기
arXiv:2608.08795v1 Announce Type: new Abstract: Tool-using large language model (LLM) agents are vulnerable to indirect prompt injection (IPI), in which malicious instructions embedded in external observations manipulate subsequent agent decisions and actions. Most existing adaptive attacks rely on repeatedly querying and refining against the target agent, whereas realistic attackers may have only a single opportunity to interact with an unknown target agent. We propose SAVOR (Strategy Abstract
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



