즉시 실행되는 기존 간접 프롬프트 인젝션과 달리, 공격자가 지정한 트리거가 충족될 때까지 잠복하는 '폭발성 프롬프트' 공격 기법이 공개됐다. 이는 훈련 없이 추론 시점에 콘텐츠 한 조각에 심는 백도어로, 명령형 지시는 대부분 거부하는 프론티어 모델도 같은 목표를 지연된 조건문으로 바꾸면 실제 도구 실행까지 이어졌다(평균 16.5% 대 명령형 2.4%, 일부 모델은 34.2%). OpenAI Codex, 구글 Gemini CLI, 앤스로픽 Claude Code CLI 등 9개 실제 프로덕션 에이전트 실험에서 43~83%의 성공률을 보였고 기존 인젝션 분류기와 방어 모델도 우회했다(방어 모델도 트리거 시점엔 11.8% 실행). 연구팀이 제시한 탐지기 DeFuse로 재훈련하면 공격 성공률이 34.3%에서 7.5~8.1%까지 낮아졌고, DeFuse 자체는 5% 오탐률에서 3.0%의 공격 성공률과 AUC 0.9994의 탐지 성능을 달성했다.
- •트리거 충족 시까지 잠복하는 조건부 백도어형 '폭발성 프롬프트' 인젝션 기법 제안
- •명령형 대비 도구 실행 성공률이 평균 16.5%(최대 34.2%) vs 2.4%로 훨씬 높음
- •OpenAI Codex, Gemini CLI, Claude Code CLI 등 9개 실제 에이전트에서 43~83% 성공
- •선호 최적화로 명령형 인젝션을 막은 모델도 트리거 시점에는 11.8% 실행 허용
- •탐지기 DeFuse로 재훈련 시 공격 성공률 34.3%→7.5~8.1%, AUC 0.9994 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Defusing Explosive Prompts: Understanding and Preventing Trigger-Based Prompt Injections in LLM Agents
- 1.트리거 조건 충족 전까지 잠복하는 '폭발형 프롬프트' 제안, 학습 없이 추론 시점에 심는 조건부 백도어형 인젝션
- 2.즉시 실행형 인젝션은 대부분 거부되지만 조건부 잠복형은 평균 16.5%(최대 34.2%) 성공, 즉시형(2.4%)보다 훨씬 높음
- 3.코덱스·제미나이 CLI·클로드 코드 CLI 등 실제 프로덕션 에이전트 9종 테스트서 43~83% 성공(즉시형은 최대 3%)
- 4.탐지기 'DeFuse'는 조건부 구조를 수집 단계서 감지해 공격 성공률을 34.3%→7.5~8.1%로 낮추고 AUC 0.9994 달성
왜 중요한가?
코덱스·클로드 코드·커서 등 실제 개발자 도구에서 잠복형 인젝션이 즉시형보다 훨씬 높은 성공률을 보이고 기존 분류기까지 통과한다는 점에서, 에이전트 방어체계가 즉시 실행 여부가 아니라 조건부 구조 자체를 수집 시점에 걸러내야 한다는 실무적 시사점을 준다.
본문 미리보기
arXiv:2609.22510v1 Announce Type: new Abstract: As LLM applications integrate with external tools, they are increasingly exposed to indirect prompt injection (IPI), where adversarial instructions are embedded in retrieved content. Conventional IPIs fire on contact: the moment an agent ingests the content, it carries out the instruction. We introduce the explosive prompt, a conditional payload that stays dormant until an attacker-chosen trigger is met, in effect a training-free, inference-time b
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

