인간은 자신의 보상 함수를, AI는 제안 행동의 품질을 각각 사적으로 아는 양방향 정보 비대칭 상황에서의 런타임 인간 감독을 게임이론으로 분석한 논문이다. CIRL(협력적 역강화학습)과 Oversight Game을 확장해 play/ask/trust/oversee 인터페이스를 갖춘 컨텍스추얼 밴딧 팀 게임을 정식화했고, 상태 전이를 제거한 밴딧 구조 덕분에 완전한 POMDP에서는 추측에 그칠 원샷 특성화를 정확히 도출했다. 팀 최적해와 근시안적 규칙 간 격차가 '회피 가능한 피해의 슬랩' — AI는 행동이 해롭고 셧다운이 낫다는 걸 알지만 사전 신뢰에 기댄 인간이 감독을 생략하는 영역 — 으로 나타나며, 이는 감독 커뮤니케이션의 비신빙성이 치르는 대가임을 보였다. 반복 라운드에서 수동 학습과 능동 시그널링으로 격차가 해소되는 동학도 부분 분석했다. AI 셧다운·감독 설계의 이론적 기초에 기여한다.
- •인간은 보상 함수, AI는 행동 품질을 각자 사적으로 아는 양방향 정보 비대칭 설정을 최초 정식화
- •CIRL·Oversight Game을 확장한 play/ask/trust/oversee 인터페이스의 컨텍스추얼 밴딧 팀 게임
- •팀 최적해와 근시안적 규칙의 격차 = 'r회피 가능한 피해 슬랩': AI는 해로움을 알지만 인간이 신뢰로 감독 생략하는 영역
- •이 격차는 감독 커뮤니케이션이 신빙성을 갖지 못하는 데 따른 대가임을 증명
- •반복 라운드에서 수동 학습·능동 시그널링으로 격차가 동적으로 해소되는 과정 부분 분석
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry
- 1.인간·AI 양방향 정보 비대칭 하의 실시간 감독을 컨텍스추얼 밴딧 게임으로 정식화
- 2.팀 최적해와 근시안적 규칙 사이 간극을 '회피 가능한 해악 영역'으로 규명
- 3.AI가 해악을 알아도 인간이 감독을 생략하는 상황을 비신뢰 소통의 대가로 해석
- 4.반복 라운드에서 수동 학습·능동 신호로 간극이 해소되는 동학을 부분 분석
왜 중요한가?
AI가 스스로 위험을 알고 있어도 인간 감독이 작동하지 않을 수 있는 조건을 수학적으로 특정한 연구로, CIRL·감독 게임 계열을 확장해 자율 에이전트의 셧다운·감독 인터페이스 설계에 이론적 기반을 제공한다.
본문 미리보기
arXiv:2607.00155v1 Announce Type: new Abstract: We study runtime human oversight of an AI agent when private information runs in both directions: the human privately knows her reward function, while the AI privately knows the quality of the action it proposes. This is the kind of asymmetry that arises naturally when an autonomous robot or software agent has inspected a situation its human supervisor cannot directly assess. Building on Cooperative Inverse Reinforcement Learning (CIRL) and the Ov
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

