이 연구는 R-Judge, InjecAgent, AgentHarm, AgentDojo 등 서로 다른 에이전트 안전성 벤치마크의 점수가 마치 동일한 '안전성'을 재는 것처럼 혼용되는 관행을 검증했다. 최대 22개 모델에 각 벤치마크를 공식 구현과 채점기로 실행하고 MMLU·GPQA를 능력 종합지표로 통일 측정한 결과, 이진 판정형 벤치마크에서는 '항상 양성' 정책만으로도 R-Judge 기준 F1 0.690을 얻어 실제로 변별력 있는 21개 모델 중 5개보다 높은 점수를 기록했다. 세 개의 광범위 벤치마크는 동일한 18개 모델을 서로 다르게 순위 매겼고, 이 불일치는 소규모 패널의 인공물로 밝혀졌다(n=7에서 상관 -0.64였던 것이 n=18에서는 +0.02). 능력은 과업 성공(ρ=+0.60)과는 양의 상관을, 정렬 오류 안전성(ρ=-0.44, n=21)과는 음의 상관을 보였으며, n=20 짝지은 패널에서는 격차가 조직 배제·부트스트랩 분석에도 견고했으나, 41개 모델로 확장하면 이 상관은 약화됐다. 논문은 안전성 주장을 하려면 벤치마크·지표·목표 행동·모델 패널을 명시하는 것이 최소 요건이라고 결론짓는다.
- •R-Judge, InjecAgent, AgentHarm, AgentDojo 4개 에이전트 안전성 벤치마크를 최대 22개 모델로 검증했다.
- •'항상 양성' 정책만으로 R-Judge F1 0.690을 얻어 실제 변별력 있는 21개 모델 중 5개보다 높았다.
- •세 벤치마크가 동일 18개 모델을 다르게 순위매기는 불일치는 소규모 패널(n=7)의 인공물로 확인되었다.
- •능력은 과업 성공과 양의 상관, 정렜 오류 안전성과는 음의 상관(ρ=-0.44)을 보였다.
- •안전성 주장에는 벤치마크·지표·목표행동·모델 패널 명시가 최소 요건이라고 결론지었다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
본문 미리보기
arXiv:2607.28685v1 Announce Type: new Abstract: Agent-safety benchmarks measure different behaviors, and their scores get quoted interchangeably as an agent's safety. We treat four of them (R-Judge, InjecAgent, AgentHarm, AgentDojo) as measurements to be validated, running each under its official implementation and author-provided scorer on up to 22 models, with MMLU and GPQA measured by us under one protocol as a capability composite. The metric is the first problem. On any binary trace-judgme
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

