에이전트 행동을 인간의 도덕 가치에 정렬하려면 사회와 개인이 지닌 다양한 도덕적 관점의 다원성을 어떻게 반영할지가 문제가 된다. 도덕적 불확실성 연구는 여러 도덕 이론의 평가를 공정·민주적으로 집계하는 메커니즘을 제안하지만, 이 논문은 집계 시 맥락 요인을 반드시 고려해야 한다고 주장한다. 예컨대 결과주의 관점은 행동이 세계를 어떻게 바꾸는지 정확히 알 수 있다고 가정하지만, 현실에서는 성립하지 않는 경우가 많다. 저자들은 이런 맥락 요인을 반영해 도덕적 불확실성 하의 의사결정을 형식화하고, 상식적으로 보이는 약한 파레토 원리가 위배됨을 보인다. 이는 사실상 심슨의 역설의 한 변형으로, 맥락 요인을 무시하는 집계 메커니즘의 한계를 드러낸다.
- •도덕적 불확실성 아래 평가 집계 시 맥락 요인을 반드시 고려해야 한다는 주장
- •결과주의는 행동 결과를 정확히 예측할 수 있다고 가정하나 현실에서는 종종 성립하지 않음
- •맥락 요인을 반영한 형식화에서 약한 파레토 원리가 위배됨을 증명
- •이 문제는 심슨의 역설의 한 변형으로, 맥락을 무시한 집계 메커니즘의 한계를 드러냄
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Accounting for Context: Shaping Moral Credences for Value Alignment
- 1.도덕적 불확실성 하에서 에이전트 의사결정을 형식화하며 맥락 요인을 함께 고려
- 2.결과주의 관점은 행동의 세계 변화를 정확히 판단한다고 가정하나 현실엔 미성립
- 3.맥락을 무시한 집계가 상식적인 약 파레토 원칙을 위반함을 보임
- 4.이 문제는 심슨의 역설의 변형으로, 집계 메커니즘의 한계를 드러낸다고 주장
왜 중요한가?
AI 가치 정렬에서 다원적 도덕 관점을 공정하게 집계하려는 기존 도덕 불확실성 접근이, 맥락 요인을 무시하면 상식적 공정성 원칙(약 파레토)마저 위반함을 이론적으로 드러낸 점이 의미 있다.
이 연구는 AI의 도덕적 가치 정렬 시 다양한 관점을 고려하는 방법을 다룹니다. 한국에서도 AI 윤리 및 신뢰성 확보에 대한 논의가 활발한 만큼, 복잡한 사회적 가치 체계를 AI에 내재화하는 접근 방식은 정책 입안자와 개발자에게 중요한 시사점을 제공할 것입니다.
본문 미리보기
arXiv:2606.06972v1 Announce Type: new Abstract: Ensuring that agent behaviours are aligned with human moral values inevitably raises the problem of how to account for the plurality of moral perspectives that societies -- and even individuals -- typically adopt. Work on moral uncertainty proposes mechanisms to fairly and democratically aggregate evaluations of actions across different moral theories. However, this paper argues that one needs to account for contextual factors when aggregating mor
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

