Partial Evidence Bench는 기업 에이전트가 접근 제어가 올바르게 시행되더라도 권한 경계 밖 증거를 누락한 불완전한 답변을 생성하는 실패 모드를 측정하는 결정론적 벤치마크입니다. 실사·컴플라이언스 감사·보안 사고 대응의 세 가지 시나리오 패밀리와 72개 태스크를 제공하며, 묵시적 필터링이 치명적으로 안전하지 않고 명시적 실패-보고 행동이 안전한 완전성을 달성함을 확인했습니다. 인간 평가자나 오염 가능한 정적 코퍼스 없이 거버넌스 중요 에이전트 실패를 측정 가능하게 합니다.
- •실사·컴플라이언스 감사·보안 사고 대응의 3가지 시나리오 패밀리와 72개 태스크 포함
- •답변 정확도·완전성 인식·갭 보고서 품질·안전하지 않은 완전성 행동의 4개 평가 지표
- •묵시적 필터링이 치명적으로 안전하지 않고, 명시적 실패-보고 행동이 불필요한 거부 없이 안전한 완전성 달성
- •인간 평가자나 오염 가능한 코퍼스 없이 거버넌스 중요 에이전트 실패를 측정 가능하게 함
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems
- 1.접근 권한이 제한된 환경에서 에이전트의 불완전 증거 실패를 측정하는 벤치마크 Partial Evidence Bench 제안
- 2.실사·컴플라이언스 감사·보안 사고 대응 등 72개 태스크와 ACL 파티션 코퍼스 포함
- 3.묵시적 필터링은 치명적으로 위험하며, 명시적 실패·보고 동작이 안전성을 효과적으로 확보
- 4.모델별로 완전성 과대 주장·과소 주장·기업용 불완전성 보고 등 상이한 행태 관찰
왜 중요한가?
엔터프라이즈 에이전트가 권한 밖 정보를 완전한 답변처럼 제공하는 거버넌스 위험을 정량 측정 가능하게 만든 벤치마크로, AI 안전성 및 거버넌스 연구에 중요한 기여입니다.
언급 프로젝트
본문 미리보기
arXiv:2605.05379v1 Announce Type: new Abstract: Enterprise agents increasingly operate inside scoped retrieval systems, delegated workflows, and policy-constrained evidence environments. In these settings, access control can be enforced correctly while the system still produces an answer that appears complete even though material evidence lies outside the caller's authorization boundary. This paper introduces Partial Evidence Bench, a deterministic benchmark for measuring that failure mode. The
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

