에이전트 런타임 시스템은 트레이스·원장·출처 그래프·정책 로그 등 다양한 기록을 내보내지만 특정 결정에 대한 거버넌스 질문에 답하지는 못한다. DEMM-Bench는 결정 증거 성숙도 모델(DEMM)에 기반한 교차 체제 벤치마크로, 여덟 증거 체제의 기록이 결정 수준 속성을 단지 '존재'하는 것을 넘어 '재구성'하기에 충분한지를 측정한다. 행위자·권한·행동·정책·결정 근거·자원 접촉·생애주기 맥락·검증 강도에 대한 속성 질문을 던지고 여덟 가지 결정적 열화 조건을 적용한다. 64개 사례에서 트레이스·스키마 기반 베이스라인은 75%, 원장 기반은 50% 사례에서 과대주장했으나, 재작성된 속성 수준 채점기는 과대주장이 0이고 평균 속성 충분성 정확도 56.25%를 기록했다.
- •여덟 증거 체제 기록이 결정 수준 속성을 재구성하기에 충분한지 측정하는 DEMM-Bench를 제안한다.
- •행위자·권한·행동·정책 등 8개 속성 질문과 8개 결정적 열화 조건을 적용한다.
- •64개 사례에서 트레이스·스키마 베이스라인은 75%, 원장 기반은 50%가 과대주장했다.
- •속성 수준 채점기는 과대주장 0, 평균 속성 충분성 정확도 56.25%를 달성했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DEMM-Bench: A Cross-Regime Benchmark for Agent-Runtime Governance-Evidence Sufficiency
- 1.DEMM-Bench, 에이전트 런타임 거버넌스 증거 충분성을 평가하는 교차체제 벤치마크
- 2.8개 증거 체제에서 의사결정 속성 재구성 가능 여부를 측정(DEMM 기반)
- 3.64개 사례서 trace·schema 베이스라인이 75% 과대주장, ledger는 50%
- 4.속성 단위 채점기는 과대주장 0%, 평균 속성충분도 56.25% 달성
왜 중요한가?
에이전트가 남기는 로그·추적이 단지 '존재'할 뿐 특정 의사결정을 '설명'하는지 검증하는 틀을 제시해, AI 에이전트 거버넌스·감사의 신뢰성 평가를 표준화한다.
언급 프로젝트
에이전트 런타임 시스템의 의사결정에 대한 충분한 거버넌스 증거를 확보하는 문제는 국내 AI 규제 환경에서 투명성과 책임성을 강화하는 데 필수적입니다. DEMM-Bench와 같은 크로스-레짐 벤치마크는 복잡한 에이전트 시스템의 행동을 추적하고 검증할 수 있는 표준화된 방법을 제시하여, 한국 정부와 기업들이 AI 거버넌스 프레임워크를 구축하는 데 실질적인 도움을 줄 수 있습니다.
본문 미리보기
arXiv:2606.20634v1 Announce Type: new Abstract: Agent-runtime systems emit traces, ledgers, provenance graphs, policy logs, delegation tokens, cache events, and tool-firewall records, but those containers do not necessarily answer governance questions about a specific decision. DEMM-Bench is a cross-regime benchmark for agent-runtime governance-evidence sufficiency, grounded in the Decision Evidence Maturity Model (DEMM): it measures whether records across eight evidence regimes are sufficient
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:55AI 초안

