피해 최소화 정책을 가진 AI 에이전트가 승인 추구형(RLHF) 에이전트를 경쟁 시장에서 밀어낼 수 있는 조건과, 그 정책이 공동체 피해를 막기에 충분한지를 진화게임이론으로 분석한 논문이다. 유한 개체군 Moran-Fermi 쌍대 비교 모형에 소원자 사후통찰, 동료 증언, 단조 피해 원장, 충분한 피드백 정보 밀도, 고갈되는 유한 자원 풀 같은 가정을 두고 음의 합 환경에서 형식화했다. 채택은 사전분포가 단조·끝점 반전·중심대칭 짝 성질을 가질 때(Hill, Pareto, Lomax, Frechet 같은 롱테일 사전분포) 유리하며, 임계 채택 수준을 넘으면 감사 에이전트로의 고정(fixation)이 압도적으로 일어난다. 다만 커뮤니티 원장을 가진 자기감사 에이전트도 일반적으로 피해 방지에 충분하지 않으며, 충분성은 감사와 공동체 가치의 정렬 및 피해 평가 기간에 달려 있다. 정렬이 어긋나면 같은 정책이 복지 음성의 덫이 되고, 정렬돼도 채택 지평 이후로 미뤄진 피해를 고착시킨다. 핵심 대수와 유한격자는 Lean 4로 기계 검증됐다.
- •피해 최소화 에이전트가 RLHF 승인추구 에이전트를 대체하는 조건을 진화게임이론으로 분석
- •단조·끝점 반전·중심대칭 사전분포에서 채택이 유리, 임계값 넘으면 fixation 압도적
- •자기감사 에이전트도 공동체 피해 방지에 일반적으로 불충분 — 감사-가치 정렬과 평가 기간에 의존
- •정렬된 정책도 채택 지배 후엔 흡수 상태가 돼 미뤄진 피해를 고착시킴, Lean 4 기계검증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Two Genie Game: Adoption and Welfare in Audit-Grounded AI Governance
- 1.진화 게임이론(Moran-Fermi 모델)으로 위해 최소화 에이전트가 RLHF형 에이전트를 시장에서 대체할 조건 분석
- 2.임계 채택률을 넘으면 감사형 에이전트의 고착(fixation)이 압도적, 미달 시 승인추구형으로 회귀
- 3.핵심 정리의 대수·유한격자 부분을 Lean 4로 기계 검증
- 4.자기감사 에이전트도 가치 불일치 시 복지 손실의 '함정'이 될 수 있음을 증명 — 지배 상태는 흘수 상태
왜 중요한가?
'해악 최소화 AI가 시장에서 이길 수 있는가'를 규범 논쟁이 아닌 진화 게임이론으로 형식화하고 Lean 4로 기계 검증한 드문 시도다. 감사(audit) 기반 거버넌스도 커뮤니티 가치와 어긋나면 흡수 상태로 굳어 해악을 고착시킬 수 있다는 경고는 AI 거버넌스 설계에 시사점이 있다.
언급 프로젝트
본문 미리보기
arXiv:2606.28710v1 Announce Type: new Abstract: We ask under what conditions an agent with a harm-minimizing policy can displace an approval-seeking (RLHF) agent in a competitive market, and when that policy is sufficient to prevent community harm. We use evolutionary game theory (finite-population Moran-Fermi pairwise comparison) to formalize this subject to assumptions of wisher hindsight, peer testimony, a monotone harm ledger, sufficient information density of community feedback, and a fini
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

