참여형 설계나 AI 정렬에서 표준 도구로 쓰이는 국소적 쌍대 비교(pairwise comparison)가 '내적 다원주의(internal pluralism)' 아래에서 체계적으로 실패할 수 있음을 형식 모델로 보인 연구다. 개인이 비례성, 평등주의, 동등 대우 같은 복수의 우선순위로 결정 규칙을 평가할 때, 이런 우선순위는 본질적으로 전역적이어서 국소 비교로 포착되지 않으며, 강하게 충돌하는 우선순위 간 긴장은 강제 응답 시 행동 왜곡을 낳는다. 대안으로 '미결정(indecision)' 응답을 허용하면 선호를 정확히 학습하는 데 필요한 질의 수를 크게 줄일 수 있음을 확인했다. 쌍대 비교 기반 선호 학습(RLHF 등)의 근본 가정에 의문을 제기하고, 우선순위를 직접 이끌어내는 선호 학습 방법의 필요성을 시사한다.
- •개인이 복수의 권위 있는 우선순위로 결정 규칙을 평가하는 '내적 다원주의'를 형식화한 모델 제시
- •비례성·평등주의 같은 우선순위는 전역적 속성이라 국소 쌍대 비교로 포착 불가
- •강제된 비교 응답은 우선순위 충돌 시 비용이 큰 행동 왜곡을 유발
- •미결정 응답 허용 시 선호 학습에 필요한 질의 수가 크게 감소
- •우선순위를 직접 이끌어내는 더 충실하고 해석 가능한 선호 학습 방법론 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Internal Pluralism and the Limits of Pairwise Comparisons
- 1.선호 학습의 표준 도구인 국소적 쌍대비교(pairwise comparison)의 두 가지 구조적 실패를 형식 모델로 입증
- 2.비례성·평등주의 같은 우선순위는 본질적으로 전역적이라 국소 비교로 포착 불가
- 3.강하게 유지되는 우선순위 간 충돌 시 강제 응답이 행동 왜곡을 유발한다는 점도 분석
- 4.'미결정(indecision)' 응답을 허용하면 정확한 선호 학습에 필요한 질의 수가 크게 감소
왜 중요한가?
RLHF 등 정렬 파이프라인의 기본 데이터 수집 방식인 강제 쌍대비교가, 한 사람 안에 복수의 가치 기준이 공존하는 '내적 다원주의' 하에서 체계적으로 왜곡된 신호를 만든다는 지적이다. 선호 데이터 수집 설계 자체를 재고해야 한다는 정렬 방법론 차원의 문제 제기다.
본문 미리보기
arXiv:2607.02672v1 Announce Type: new Abstract: Local pairwise comparisons are a standard tool for learning how people want decision rules to work, e.g., in participatory design or alignment. However, their use builds in two strong assumptions: that local comparisons are sufficient evidence about how a person wants an automated decision rule to behave, and that people can always answer those comparisons decisively. We investigate how these assumptions may be compromised under internal pluralism
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

