외부 자원과 연동된 LLM 에이전트는 신뢰할 수 없는 외부 데이터가 추론 중 행동 지시 명령으로 동적 해석돼 프롬프트 인젝션에 취약해질 수 있다. 기존 방어는 입출력 단의 정적 탐지·격리에 그쳐 추론 도중 발생하는 동적 유도를 잡아내지 못했다. 연구진이 제안한 Attnlocate는 이를 객체 탐지 문제로 재구성해, 어텐션 행렬 내에서 행동 유도 명령이 남기는 고유한 활성화 흔적을 다중 헤드·다중 레이어 집계로 특징화하고 앵커프리 1D U-Net으로 해당 구간을 탐지한 뒤, 탐지된 구간의 제공자 권한에 따라 악성 호출 여부를 동적으로 판정한다. 5개 LLM 계열, 10개 에이전트 구성에서 평균 IoU 0.743, AUROC 0.956, 위양성률 0.067에서 진양성률 0.934를 달성했고 미학습 모델에도 재훈련 없이 전이됐다.
- •프롬프트 인젠션 탐지를 어텐션 행렬 기반 객체 탐지 문제로 재구성
- •5개 LLM 계열·10개 에이전트 구성에서 AUROC 0.956, IoU 0.743 달성
- •위양성률 0.067에서 진양성률 0.934로 고정밀도 탐지
- •미학습 모델에도 재훈련 없이 전이되며 권한 정책 적응 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions
- 1.LLM 에이전트 프롬프트 인젝션을, 어텐션에 남는 행동유도 지시문 흔적 탐지 문제로 재정의한 Attnlocate 제안
- 2.다중헤드·레이어 어텐션을 집계해 1D U-Net 앵커프리 탐지헤드로 행동유도 구간 특정
- 3.5개 LLM·10개 에이전트 구성에서 평균 IoU 0.743, AUROC 0.956, FPR 0.067에 TPR 0.934
- 4.미학습 모델로도 전이되며 재학습 없이 권한정책 조정만으로 판정 가능
왜 중요한가?
입출력 수준 정적탐지에 머물던 기존 방어와 달리 실제 의사결정에 영향을 준 지시문 구간을 정밀히 짚어 인젝션 방어 정밀도를 높인다.
언급 프로젝트
외부 자원을 활용하는 LLM 에이전트의 무단 행위를 판단하는 이 연구는 국내 AI 에이전트 서비스 개발자들에게 핵심적인 시사점을 줍니다. 주입 공격 등으로 인해 에이전트가 의도치 않은 행동을 할 수 있는 위험이 큰 상황에서, 행동 지침을 추적하고 통제하는 기술은 기업의 AI 도입 확산을 위한 신뢰성 확보에 필수적입니다. 이는 AI 윤리 및 거버넌스 측면에서도 중요한 과제입니다.
본문 미리보기
arXiv:2608.24022v1 Announce Type: new Abstract: LLM agents integrated with external resources gain complex task capabilities, yet the unified natural-language context channel makes them vulnerable to injection attacks: untrusted external data may be dynamically parsed as behavior-guiding instructions during LLM inference, thereby subverting the agent's decision. Existing defenses focus on static detection or isolation of malicious content at the input/output level, remains insufficient for dete
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
