간접 프롬프트 인젝션(IPI)은 도구를 사용하는 LLM 에이전트가 읽는 콘텐츠에 악성 지시를 심어 유해한 도구 호출을 유도하는 공격이다. 연구진은 값이 사용자, 사용자가 명시적으로 지정한 출처, 또는 사용자 자신의 권위 있는 기록으로 위조 불가능하게 추적될 때만 상태 변경 도구에 도달할 수 있다는 신뢰 구조 개념에 기반한 방어 기법 'ROPE(Routed Origin Policy Enforcement)'를 제시했다. ROPE는 감사 가능한 민감 도구 매개변수 집합에 대한 결정론적 출처 검사로 집행되며, 언어모델에 대한 의존은 공격자의 손이 닿지 않는 신뢰할 수 있는 사용자 요청에만 한정된다. 4개 에이전트 모델을 대상으로 한 오픈엔드 에이전트 스위트 평가에서 ROPE는 공격 성공률을 1.6~2.6%로 억제하면서도 방어 없는 상태 대비 82~100%의 정상 효용을 유지해, 기존 시스템 수준 방어보다 효용 면에서 크게 앞서면서 동등하거나 더 나은 보안성을 달성했다.
- •간접 프롬프트 인젝션 방어를 위한 구조적 신뢰 기반 기법 ROPE 제안
- •값이 사용자·지정 출처·사용자 기록으로 위조 불가능하게 추적될 때만 도구 실행 허용
- •민감 도구 매개변수에 대한 결정론적 출처 검사로 집행, LLM 의존은 사용자 요청에만 한정
- •공격자 콘텐츠 유래 값의 도달 차단과 인젝션 재구성 무효화를 증명가능하게 보장
- •4개 모델 평가에서 공격성공률 1.6~2.6%, 정상효용 82~100% 유지로 기존 방어 상회
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection
- 1.툴 실행 파라미터의 출처를 추적해 간접 프롬프트 인젠션을 막는 'ROPE' 제안
- 2.값이 사용자·사용자가 명시한 출처·공식 기록으로 위조불가능하게 추적될 때만 민감 툴 파라미터 도달 허용
- 3.4개 에이전트 모델에서 공격성공률 1.6~2.6%로 억제하면서 정상 유용성 82~100% 유지
- 4.ROPE를 표적으로 한 인젠션 최적화는 거의 무력화, 기존 방어를 뚣던 장기공격도 성공률 0%
왜 중요한가?
기존 시스템 수준 방어는 보안-유용성 트레이드오프가 컸는데, 값의 출처를 결정론적으로 검증하는 구조적 신뢰 개념으로 두 마리 토끼를 모두 잡아 실전 에이전트 배포에 바로 적용 가능한 방어를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.27496v1 Announce Type: new Abstract: Indirect prompt injection (IPI) plants instructions in the content a tool-using LLM agent reads, steering the agent into harmful tool calls. The strongest defenses are system-level, leveraging techniques such as task-conditional tool screening to prevent execution of malicious tools, and information-flow control to avoid tool execution with untrusted parameters. However, as agents grow more capable, users delegate more to automation. Consequently,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
