이 논문은 신뢰되지 않은 외부 데이터를 다루는 AI 에이전트를 겨냥한 시각적 프롬프트 인젝션 공격 'Repeat-After-Me'를 제시한다. 텍스트 영역의 블랙박스 프롬프트 인젝션은 거의 완벽한 공격 성공률을 보였지만, 기존 시각적 방식은 정밀한 도구 호출 같은 길고 형식이 엄격한 목표 문자열을 만들어야 해서 최신 상용 VLM 공격에는 효과가 떨어졌다. Repeat-After-Me는 개인식별정보를 유출시키거나 악성 도구 호출을 유도할 수 있는 적응형 공격으로, Qwen3.6-27B와 GPT-5.5를 포함한 오픈웨이트·상용 VLM 전반에서 사용자 프롬프트가 주입된 작업과 무관하고 이를 언급하지도 않는 현실적 조건에서 각각 80% 이상, 47% 이상의 공격 성공률을 달성했다. 실제 OpenClaw 디스코드 배포 환경에서는 최소한으로 조작된 이미지 하나로 TOOLS.md를 덮어써 원격 코드 실행과 비밀 유출 같은 민감한 동작을 가능케 하는 것을 시연했다.
- •개인정보 유출·악성 도구 호출을 유도하는 적응형 블랙박스 시각적 프롬프트 인젝션 'Repeat-After-Me' 제안
- •Qwen3.6-27B, GPT-5.5 등에서 각각 80%, 47% 이상의 공격 성공률 달성(무관한 사용자 프롬프트 조건에서)
- •대체 모델로 최적화한 공격이 실제 상용 모델에서도 43~46% 성공률 유지, 교차 샘플 전이율 64~66%
- •실제 OpenClaw 디스코드 배포에서 이미지 하나로 TOOLS.md 덮어써 원격 코드 실행·비밀 유출 가능성 시연
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection
- 1.이미지 기반 블랙박스 적응형 프롬프트 주입 공격 Repeat-After-Me 제시, 개인정보 유출·악성 도구호출 유도
- 2.Qwen3.6-27B·GPT-5.5 등 상용 VLM 대상 공격성공률 각각 80%·47% 이상 달성, 사용자 프롬프트와 무관한 상황에서도 성공
- 3.OpenClaw 디스코드 실배포 환경에서 최소한의 주입 이미지로 TOOLS.md를 덮어써 원격코드실행·비밀유출로 이어질 수 있음을 실증
- 4.한 모델에서 최적화한 공격이 다른 모델에도 43~66% 전이됨을 확인
왜 중요한가?
텍스트 프롬프트 주입 방어가 발전해온 반면 이미지 기반 주입은 상대적으로 덜 연구됐는데, 이 결과는 실제 배포된 에이전트 환경에서 이미지 하나로 원격코드실행까지 이어질 수 있음을 보여줘 멀티모달 AI 에이전트 보안의 시급한 공백을 드러낸다.
본문 미리보기
arXiv:2609.04533v1 Announce Type: new Abstract: Prompt injection is widely recognized as a major security threat to AI agents that interact with untrusted external data, such as websites, documents, and emails. Prior work has shown that, in the text domain, black-box prompt injection can achieve near-perfect attack success rates (ASRs). In the image domain, however, existing visual prompt injection methods are substantially less effective in attacking frontier commercial VLMs for materially har
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
