이 연구는 에이전트형 LLM이 간접 프롬프트 인젝션(IPI) 공격에 노출됐을 때 내부적으로 이를 감지하는 신호를 이미 갖고 있다는 사실을 밝혔다. GLM-5.2(7530억 파라미터), Kimi-K3(2.8조 파라미터) 등 8개 모델을 대상으로 생성 이전 은닉 상태에 단순 선형 프로브를 학습시킨 결과, 처음 보는 공격과 에이전트 지시, 과제 세트에서도 0.90 이상의 AUROC로 IPI 노출을 예측했다. 그러나 후속 학습된 모델들은 이 신호를 안전한 행동과 안정적으로 연결하지 못하는 '지식-행동 격차'가 있음을 발견하고, 테스트 시점에 이 격차를 메우는 프로브 게이팅 기반 방어를 제안해 AgentDojo 어려운 설정에서 Qwen3.5-27B의 공격 성공률을 34.6%에서 0%로 낮췄다. 모델별로 위험 신호가 직접적 IPI 감지와 연결되는지, 간접적 단서와 연결되는지 양상이 다르게 나타났다.
- •8개 모델의 생성 이전 은닉 상태에서 선형 프로브로 IPI 노출을 0.90+ AUROC 예측
- •미지의 공격·언어에서도 프로브가 견고하게 IPI 노출을 예측
- •모델이 위험 신호를 감지하지만 안전 행동으로 연결하지 못하는 '지식-행동 격차' 발견
- •프로브 게이팅 방어로 Qwen3.5-27B의 공격 성공률을 34.6%에서 0%로 감소
- •모델별로 위험 신호가 직접적/간접적 단서와 연결되는 양상이 상이
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure
본문 미리보기
arXiv:2608.02657v1 Announce Type: new Abstract: Agentic LLMs are vulnerable to indirect prompt injection (IPI) attacks, e.g., malicious side-tasks hidden in external tool results. While many efforts have sought to address the threats, little is known about the internals of agentic LLMs when they are exposed to IPI attacks, a condition which we call IPI exposure. In this paper, we study this problem in depth from three aspects. (1) Probing: Across six models, including the giant 753B-parameter G
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



