연구진이 LLM 에이전트의 분해 공격(해로운 요청을 무해한 하위 요청으로 분할)과 프롬프트 주입 공격을 통합적으로 모니터링하는 프레임워크와 약 6200개의 대화 트랜스크립트로 구성된 벤치마크를 제안했다. 기존 평가는 두 위협을 따로 다루며 궤적이 유해한지만 물었지만, 이 연구는 에이전트의 응답을 외부화해 모니터가 '언제' 유해함을 처음 포착하는지, 즉 첫 유해 행위 확정부터 목표 실행까지의 '위해 구간' 안에 포착이 이뤄지는지를 평가했다. 17개 모니터 구성을 실험한 결과, 제안된 행위 중심 모니터는 두 위협 모두에서 높은 성능(AUC 0.95, 0.99)을 보인 반면 콘텐츠 중심 모니터는 주입 공격에서 크게 저하됐다(AUC 0.52). 또한 기존의 위치 무시 지표는 모니터 성능을 지나치게 낙관적으로 평가한다는 사실도 확인됐다.
- •LLM 에이전트의 분해 공격·프롬프트 주입 공격을 통합 평가하는 프레임워크·벤치마크(약 6200건) 제안
- •유해 여부가 아니라 '언제' 유해함이 포착되는지(위해 구간 내 포착 여부)를 평가 기준으로 제시
- •행위 중심 모니터, 두 위협 모두에서 높은 성능(AUC 0.95·0.99)
- •콘텐츠 중심 모니터는 프롬프트 주입 공격에서 성능 급락(AUC 0.52)
- •기존 위치 무시 지표는 모니터 성능을 과도하게 낙관적으로 평가한다는 점 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Towards a Unified Misuse Monitoring Benchmark
- 1.분해공격(decomposition)과 프롬프트 인젝션 두 오용 위협을 통합 평가하는 트레이스 수준 감시 벤치마크 제안
- 2.약 6200개 대화 트랜스크립트에 해악구간(harm window) 라벨, 양성대조, 거부 사례까지 포함해 구성
- 3.행동기반(action-framed) 감시기는 두 위협 모두 AUC 0.95·0.99, 콘텐츠기반 감시기는 인젝션에서 0.52로 붕괴
- 4.기존 위치무관(position-blind) 지표는 지나치게 낙관적이며, 모든 감시기가 분해공격 위치파악엔 취약함을 확인
왜 중요한가?
에이전트가 언제 유해해지는지를 구분하지 못하면 실시간 개입이 어려운데, 이번 연구는 오용 시점까지 정밀하게 라벨링한 통합 벤치마크로 감시기의 실제 탐지시점 성능을 드러내 LLM 에이전트 안전감시 설계에 구체적 평가 기준을 제공한다.
본문 미리보기
arXiv:2610.07089v1 Announce Type: new Abstract: LLM agents increasingly act in multi-actor environments, exposing them to misuse from multiple sources: decomposition attacks, where a harmful request is split into innocuous sub-requests, and prompt injection attacks, where a compromised tool delivers a malicious instruction. Existing evaluations treat these threats separately and ask whether a trajectory is harmful, rather than when it becomes harmful. We propose monitoring the agent's responses
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

