인간 선호를 고정 목표로 추론·최적화하는 기존 AI 정렬 접근 대신, 선호가 상호작용을 통해 구성되고 변한다는 전제에서 출발하는 'Constructive Alignment' 패러다임을 제안한 논문이다. 행동경제학·심리학·구성주의 사회이론에 근거해 선호를 계층적 상태 변수로 모델링하고, AI의 행동과 상호작용 설계가 세계 상태와 인간의 평가 상태를 함께 바꾸는 제어이론 프레임워크로 정식화했다. 정렬의 핵심은 AI 행동 통제가 아니라 AI가 인간 가치 궤적에 미치는 영향을 규율해 일관성, 반성적 승인, 조작 방어를 보장하는 것이라고 주장한다. 개인화된 AI가 사용자 가치관 형성에 참여하는 시대에 정렬 논의의 틀을 바꾸는 제안이다.
- •선호를 고정 타깃으로 보는 기존 정렬 가정이 '선호는 상호작용으로 구성된다'는 실증 연구와 충돌한다고 지적
- •선호를 계층적 상태 변수로 모델링하고 선호 궤적에 대한 제어 문제로 정렬을 재정의
- •정렬 목표: 가치 궤적의 일관성, 반성적 승인, 인식적 근거, 조작 방어, 불확실성 하 임파워먼트
- •AAAI-26 기계윤리 워크숍 논문, Max Kanwal·Caryn Tran 저
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
- 1.정렬을 고정 선호 만족이 아닌 '진화하는 인간 선호 궤적'의 제어 문제로 재정의
- 2.선호를 층위적 상태 변수로 모델링, 제어이론 프레임워크로 AI-인간 상호작용 형식화
- 3.가치 궤적의 일관성·반성적 승인·조작 방어·임파워먼트를 정렬 목표로 제시
- 4.정렬의 핵심은 AI 행동 통제가 아니라 장기적 가치 형성의 거버넌스라고 주장
왜 중요한가?
개인화된 AI가 장기적으로 사용자의 가치관 자체를 바꾼다는 실증적 사실을 정면으로 수용해, 정렬 문제의 초점을 'AI 행동 통제'에서 '인간 선호 진화의 규율'로 옮긴 패러다임 제안이다. 추천시스템·챗봇의 선호 조작 논쟁에 제어이론 기반의 형식적 분석 틀을 제공한다.
본문 미리보기
arXiv:2607.00001v1 Announce Type: new Abstract: Most approaches to AI alignment treat human preferences as fixed targets to be inferred and optimized. This assumption conflicts with extensive empirical evidence showing that preferences are layered, dynamic, and constructed through interaction--particularly with adaptive technologies. As AI systems become more persistent, personalized, and socially embedded, they increasingly participate in shaping what people attend to, value, and endorse over
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

