프린스턴 등 연구진이 여러 '도덕 에이전트'의 판단을 조합해 LLM을 인간 가치에 맞추는 다층 조합 융합 프레임워크 'MCF-CVA'를 제안했다. 기존 RLHF나 CAI 등은 단일 에이전트와 통합된 보상 체계에 의존해 윤리적 다원성이나 다양한 도덕적 맥락을 반영하기 어려웠다는 문제의식에서 출발한다. MCF-CVA는 각기 다른 가치를 대표하도록 미세조정된 여러 도덕 에이전트의 출력을 점수·순위 기반으로 조합적으로 확장한 뒤 다시 축소하는 과정을 여러 층에 걸쳐 반복하며, 유클리드 점수 공간과 케메니 순위 공간의 이중 구조에서 작동한다. 표준 지표 평가에서 단일 에이전트 기준선, 다중 에이전트 단일층 방식, 기존 조합 기법을 모두 능가해 맥락에 맞는 가치 정렬을 위한 견고한 메커니즘임을 입증했다.
- •서로 다른 가치를 대표하는 복수의 도덕 에이전트를 확장·축소(EAR) 과정으로 반복 조합
- •점수 기반과 순위 기반 조합을 모두 사용하는 유클리드-케메니 이중 아키텍처 채택
- •단일 에이전트, 다중 에이전트 단일층, 기존 조합 기법 대비 표준 지표에서 우수한 성능
- •에이전트 간 인지적 다양성을 활용해 충돌과 중복을 완화하는 것이 핵심 아이디어
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Contextual Value Alignment via Multilayer Combinatorial Fusion
본문 미리보기
arXiv:2608.07642v1 Announce Type: new Abstract: Aligning large language models (LLMs) with human values remains a major challenge, especially for trustworthy AI. While existing approaches such as RLHF, CAI, and their variants have achieved promising results, they often rely on a single-agent framework and a unified reward system. This limits their ability to capture ethical pluralism, adapt to diverse moral contexts, and reflect the dynamics of multi-agent moral reasoning. In this work, we pr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

