이 연구는 간접 프롬프트 인젝션(IPI) 같은 악성 지시를 텍스트에서 탐지하는 문제를, 문맥과 질의를 함께 고려하는 세그먼트 수준 분류기로 다룬다. 기존 접근법 중 어느 것도 질의 상대적 세그먼트 수준 탐지와 적응형 회피 공격에 대한 강건성을 동시에 갖추지 못했다는 한계를 지적하며, 문맥·질의 인식 악성 문장 분류 기법을 개발했다. 이를 회피 공격에 강건하게 만들기 위해 임베딩 공간에서 투영 경사 기반 최적화로 회피를 근사하는 특징 공간 적대적 학습(AT)과, LLM 기반 의역으로 실현 가능한 회피 공격을 AT 루프에서 시뮬레이션하는 두 번째 방법을 제안했으며, 두 AT 변형 모두 유용성과 공격 강건성 사이의 절충을 매끄럽게 조절할 수 있도록 매개변수화했다. 실험 결과 정적 공격에서 최신 IPI 방어 기준선을 능가했고, 적응형 공격에서는 AT 변형들이 더 높은 유용성과 더 낮은 공격 성공률을 동시에 제공하는 경우가 많았으며, 최적 AT 매개변수는 응용 도메인에 따라 달라져 도메인별 튜닝이 실무적으로 필요함을 보였다.
- •문맥·질의를 함께 고려하는 세그먼트 수준 악성 문장 분류기 개발
- •임베딩 공간 투영 경사 기반 특징 공간 적대적 학습(AT) 제안
- •LLM 기반 의역으로 회피 공격을 시뮬레이션하는 두 번째 AT 방법 제시
- •정적 공격에서 최신 IPI 방어 기준선 능가
- •적응형 공격에서 유용성·낮은 공격 성공률 동시 확보, 도메인별 튜닝 필요성 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Robust Context-Aware Detection of Malicious Instructions in Text
본문 미리보기
arXiv:2608.05430v1 Announce Type: new Abstract: The remarkable instruction-following ability of modern LLMs has enabled their practical use as the minds of agents that can autonomously complete increasingly complex tasks. Therein, however, also lies their vulnerability to attacks which embed malicious instructions in text, common variants of which are known as indirect prompt injection (IPI). A fundamental task in addressing this vulnerability is successful segmentation of a given text into ben
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



