이 연구는 스코프 제한된 자격증명, 제한된 외부 접속, 읽기전용 파일시스템 등 기업 보안 정책 하에서 코딩 에이전트 12종의 성능이 어떻게 달라지는지 Terminal-Bench 2.1로 평가했다. 가장 엄격한 보안 정책에서는 작업 성공률이 최대 18.3포인트 하락하고 비용은 167.3% 증가했으며, 두 지표는 서로 상충해 성공률을 가장 잘 지키는 모델이 효율성은 가장 크게 잃는 것으로 나타났다. 즉 어떤 모델을 선택할지는 적용되는 보안 정책에 따라 달라진다. 정책이 행동을 차단할 때 에이전트는 조기에 멈추기보다 타임아웃이나 잘못된 해결책으로 흘러가는 경향을 보였고, 연구진은 정책 하에서도 과제가 실제로 풀릴 수 있는지 검증해 모델 실패와 정책상 불가능한 과제를 구분했다.
- •코딩 에이전트 12종을 Terminal-Bench 2.1에서 중첩된 보안 정책 강도별로 평가
- •최강 보안 정책에서 성공률 최대 18.3%p 하락, 비용은 167.3% 증가
- •성공률을 가장 잘 지키는 모델이 효율성은 가장 많이 잃어, 모델 선택이 정책 의존적
- •정책 차단 시 에이전트는 조기 중단보다 타임아웃·오답으로 흐르는 경향
- •정책 강제 평가 오픈소스 도구 Boundary-Bench 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments
본문 미리보기
arXiv:2608.02670v1 Announce Type: new Abstract: Coding agents increasingly run inside organizations whose security controls (scoped credentials, restricted egress, read-only filesystems, non-root execution) constrain them like any other software. Existing benchmarks, however, evaluate agents almost exclusively in permissive sandboxes, so it is unknown how performance changes when policy is enforced. In this work, we evaluate 12 coding agents on Terminal-Bench 2.1 across nested security policy l
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



