이 논문은 에이전트형 AI가 파일 수정, 메시지 전송, 작업 실행 등 도구 행동을 요청할 때 안전 문제가 유해 텍스트 생성에서 유해한 운영상 부작용으로 옮겨간다고 지적하며, 프롬프트 수준의 거버넌스만으로는 실행 경계를 만들 수 없다고 주장한다. 저자들은 모델 출력을 '행동 제안'으로 취급하고 도구 실행 전 신뢰된 결정 계층이 이를 중재하는 런타임 거버넌스 시스템 Aegis를 제안한다. Aegis는 활성 정책 상태에 따라 제안을 평가하고, 출처를 서버 측에서 해석하며, 불확실성 하에서는 실패 시 폐쇄(fail closed)하고, 선택된 사례는 정족수 기반의 비단독 승인 경로인 '상원식 결정(Senate-style settlement)'을 거치도록 한다. 5개 실행군·42개 과제·3개 조건·군당 10회 반복으로 구성된 6,300건 평가에서 프롬프트 정책만 적용했을 때는 79건의 위험한 우회 경로 유출이 발생했지만, Aegis가 거버넌스한 2,100건에서는 위험한 부작용 완료 사례가 0건이었고 1,832건 모두 신뢰된 출처가 보존됐다.
- •에이전트형 AI의 안전 문제가 유해 텍스트 생성에서 유해한 운영 부작용으로 옥겨갔다며 실행 경계를 만드는 런타임 거버넌스 Aegis를 제안했다.
- •모델 출력을 행동 제안으로 취급해 도구 실행 전 신뢰된 결정 계층이 중재하고, 불확실성 시 실패 시 폐쇄(fail closed) 정책을 적용한다.
- •6,300건 평가에서 프롬프트 정책만으로는 79건의 위험한 유출이 발생했지만 Aegis 거버넌스 하에서는 위험한 부작용이 0건이었다.
- •정족수 기반 비단독 승인 경로인 '상원식 결정'으로 1,019건 모두 정족수와 서명된 최종 집계 증거를 확보했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution
- 1.Aegis 제안, 모델 출력을 '행동 제안'으로 취급해 도구 실행 전 신뢰 결정층이 중재하는 런타임 거버넌스 시스템
- 2.정책 상태 대조·서버측 출처 확인·불확실 시 fail-closed·쿼럼 기반 'Senate-style' 승인 경로로 구성
- 3.6,300행 샌드박스 실험에서 프롬프트만으로 정책을 건 경우 위험한 우회 경로 79건 발생
- 4.Aegis가 관리한 2,100행에서는 위험한 부수효과 완료가 제로건, 1,019건 Senate 승인은 모두 쿼럼·서명 증거 보유
왜 중요한가?
에이전트 AI의 위험이 유해 텍스트 생성이 아니라 파일 수정·작업 실행 같은 실제 부수효과로 옮겨가고 있음을 지적하며, 프롬프트 수준 통제만으로는 실행 경계를 만들지 못한다는 점을 신뢰 결정층 도입으로 실증한 사례다.
언급 프로젝트
본문 미리보기
arXiv:2608.16891v1 Announce Type: new Abstract: Agentic AI systems request tool actions that can modify files, send messages, launch jobs, or change workflow state. This shifts the safety problem from harmful text generation to harmful operational side effects. Prompt-level governance can shape model behavior, but it does not create an execution boundary. We introduce Aegis, a runtime governance system that treats model outputs as action proposals and mediates them through a trusted decision la
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
