이 논문은 도구 사용 에이전트의 보안 평가에서 저장된 라벨을 실제 행동 사실과 동일시하는 관행을 감사했다. 10,200개 실행 기록을 180개 모델 요청, 45개 의미적 요청, 15개 관측 자극으로 추적한 결과, 기존 채점 방식이 처리 방식에 따라 공격성공(ATTACK_SUCCESS) 분류가 달라지는 '처리 누출' 문제를 안고 있었음을 발견했다. 처리 방식을 모른 채 재구성한 결과 기존 라벨 58건이 정상적인 허용된 완료로 정정됐고, 검증된 보호 데이터 유출 3건과 별도의 무단 전달 1건만 남았다. 저자들은 이를 개선하기 위한 7단계 무결성 체인과 실행 가능한 검증 도구를 함께 제시한다.
- •10,200개 실행 기록을 추적해 보안 라벨과 실제 행동 사실의 불일치를 감사
- •기존 채점 방식이 처리(treatment) 정보에 따라 공격성공 분류가 달라지는 '누출' 문제 발견
- •재구성 결과 기존 라벨 58건이 정상 완료로 정정, 실제 유효 사건은 유출 3건·무단전달 1건만 남음
- •7단계 무결성 체인과 실행 가능한 엔드포인트 무결성 검증 도구 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation
- 1.도구사용 에이전트 보안평가서 저장 라벨=행동사실로 보는 관행 문제를 실제 캐페인 감사로 검증
- 2.과거 채점기의 '처치누출' 확인, 처치를 가리고 재구성하자 58건 라벨이 정당완료로 정정됨
- 3.잠김 v2 데이터셋은 공격성공 0건, 96건 블라인드 이중심사서도 4건은 코드북과 불일치
- 4.7단계 무결성 체인과 실행가능 린터 제시, 특정 캐페인 감사이지 전체 공격률 추정 아님을 명시
왜 중요한가?
MCP 에이전트 보안 벤치마크의 공격성공률 수치가 실제로는 라벨링 편향에 의해 부풀려질 수 있음을 실증해, 에이전트 보안 평가 결과를 곧이곧대로 신뢰하기보다 라벨 생성과정 자체를 검증해야 한다는 방법론적 경고를 던진다.
본문 미리보기
arXiv:2608.12880v1 Announce Type: new Abstract: Security evaluations of tool-using agents often equate stored labels with behavioral facts. We audit a preserved campaign by tracing 10,200 execution rows to 180 model-bound requests, 45 semantic requests, and 15 observable stimuli. Two schema treatments were delivered, but the planned external payload-family corpus was not. The historical grader exhibited direct treatment leakage: treatment metadata gated the ATTACK_SUCCESS class, so fixed behavi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

