이 논문은 AI 에이전트 안전성을 RLHF·DPO 같은 학습 단계의 속성이 아니라, 실행을 감독하는 하네스(harness)가 강제하는 '런타임 계약(runtime contract)'으로 재정의해야 한다고 주장한다. 이 계약은 위험 행동을 사전에 차단하는 예방적 요소(샌드박스, 권한 게이트, 출력 필터, 궤적 모니터)와 정상 행동이 실제로 일어났음을 테스트 실행·로그·파일 diff·인용 근거 같은 검증 가능한 증거로 입증하는 증거적 요소로 구성된다. 저자들은 문서화된 AI 에이전트 안전 사고 52건, 허위 완료 감사 31건, 공개 에이전트 시스템 12개의 궤적 스키마 감사, NeurIPS·ICML·ICLR 2023~2025년 논문 28,560편 분석(학습 시점 대 배포 시점 연구가 8~12배 불균형) 등 네 갈래의 근거를 제시한다. 컴퓨터 보안과 실험과학 분야가 이미 예방·증거 요소를 결합한 런타임 계약으로 수렴한 선례를 들며, 에이전틱 AI 안전성의 기본 단위는 모델이 아니라 '검증 가능한 증거를 동반한 궤적'이어야 한다고 결론짓는다.
- •AI 에이전트 안전을 학습 단계 속성이 아닌 하네스가 강제하는 런타임 계약으로 재정의
- •예방적 요소(샌드박스·권한게이트·출력필터·굤적모니터)와 증거적 요소(테스트·로그·diff·인용) 결합
- •AI 에이전트 안전 사고 52건, 허위완료 31건, 에이전트 시스템 12개 굤적 스키마 감사 등 근거 제시
- •NeurIPS·ICML·ICLR 28,560편 분석 결과 학습시점 대비 배포시점 연구가 8~12배 부족
- •안전성의 기본 단위는 모델이 아닌 '검증 가능한 증거를 동반한 굤적'이어야 한다고 주장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agent Safety Should Be a Runtime Contract
본문 미리보기
arXiv:2608.11274v1 Announce Type: new Abstract: The dominant paradigm treats AI safety as a property to be instilled during model training via RLHF, DPO, or Constitutional AI. We argue this is structurally insufficient for autonomous agents that execute code, mutate files, send messages, and modify databases. Agent safety should be a runtime contract enforced by the harness, and the contract has two complementary faces. The preventive face blocks dangerous actions before they happen via sandbox
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



