사람의 인증정보를 부여받은 에이전트는 그 사람의 접근 범위를 그대로 물려받지만 사용을 제한하는 판단력은 갖추지 못해, 은닉된 지시가 다음 호출을 조작해도 모든 요청이 인증정보상 유효한 채로 유지되는 위험이 있다. 연구진은 에이전트 추론 바깥에 위치한 신뢰 경계인 '대역외 정책 집행(OBPE)'을 제시했다. OBPE는 유형화된 작업과 리소스를 인가하고, 백엔드 호출 전 쿼리를 좁히며, 응답의 레코드·필드를 필터링하거나 값을 마스킹한다. 데이터 정책 소유자가 최대 허용 범위를 설정하면 에이전트 정책은 이를 좁힐 수만 있으며, 연구진은 정책 계획이 순서에 무관하고 에이전트 정책이 상한을 넓힐 수 없음을 증명했다. Jira와 ServiceNow 모의 환경에서 4개 모델, 20개 적응형 레드팀 과제를 포함한 3,621회 시행 결과 추적 실패율이 57.6%에서 0.2%로 41.2%p 감소했고, 이행률은 79.1%에서 60.9%로 낮아졌으나 안전-유용 완료율은 21.8%p 상승했다.
- •에이전트 추론 밖의 신뢰 경계 'OBPE(대역외 정책 집행)' 제안
- •유형화된 작업 인가, 쿼리 축소, 응답 필터링·마스킹으로 데이터 노출 차단
- •정책 소유자가 최대 허용범위 설정, 에이전트 정책은 범위를 좋히기만 가능함을 증명
- •Jira·ServiceNow 모의환경 3,621회 시행에서 추적 실패율 57.6%→0.2%로 급감
- •안전-유용 완료율은 21.8%p 상승, 이행률은 79.1%→60.9%로 다소 하락
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary
- 1.에이전트에 인간 자격증명을 주면 판단력 없이 권한만 상속돼 숨은 지시에 취약해진다는 문제 제기
- 2.OBPE는 에이전트 추론 밖의 신뢰 경계로, 요청 전 쿼리 축소·응답 후 필드 마스킹을 수행
- 3.Jira·ServiceNow 목업·4개 모델·레드팀 20과제로 3,621회 시험, 실패율 57.6%→0.2%로 급감
- 4.안전-유용성 동시충족률은 21.8%p 상승, 일부 응답은 필터값을 역추론하는 한계도 확인
왜 중요한가?
에이전트에 사람 권한을 그대로 위임하는 현재 관행의 보안 위험을 정량적으로 입증하고, 프롬프트에 의존하지 않는 외부 정책 집행 계층이 실질적 방어 효과가 있음을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2608.27646v1 Announce Type: new Abstract: Give an agent a human's credential and it inherits the person's reach without the judgment that limits its use. It can sweep every reachable record into model context, where hidden instructions steer its next call, and every request stays credential-valid while the agent exceeds its job or absorbs a secret. Prompts are a brittle guardrail: one fallible reasoner interprets the task and enforces its limits. We present Out-of-Band Policy Enforcemen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
