DPO와 RLHF의 등가성은 RLHF 최적 정책이 인간 선호 응답을 선호해야 한다는 암묵적 가정이 충족될 때만 성립함을 증명한다. 이 가정이 위반되면 DPO는 절대적 정렬 대신 기준 정책 대비 상대적 이점을 최적화하여 역기능 수렴이 발생한다. 이를 해결하기 위해 증명 가능한 정렬을 갖춘 제약 선호 최적화(CPO)를 제안한다. 표준 벤치마크의 포괄적 실험에서 CPO가 최고 수준의 성능을 달성함을 확인했다.
- •DPO-RLHF 등가성은 조건부 등가성으로, RLHF 최적 정책이 선호 응답을 선호하는 경우에만 성립한다.
- •가정 위반 시 DPO는 나쁜 응답을 선호하면서도 DPO 손실을 감소시키는 역기능 수렴 해결책 공간이 존재한다.
- •CPO는 RLHF에 제약을 추가하여 증명 가능한 정렬을 제공하며 표준 벤치마크에서 최고 수준 성능을 달성한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
- 1.DPO와 RLHF의 동등성이 조건부이며 실제로 자주 위반되는 암묵적 가정에 의존함을 수학적으로 증명
- 2.가정 위반 시 DPO가 선호되지 않는 응답을 선호하는 방향으로 최적화되는 병리적 수렴 현상 발생
- 3.해결책으로 Constrained Preference Optimization(CPO)을 도입해 입증 가능한 정렬을 보장
- 4.표준 벤치마크 실험에서 CPO가 최첨단 성능 달성
왜 중요한가?
널리 사용되는 DPO 정렬 방법의 근본적인 한계를 이론적으로 밝히고 더 신뢰할 수 있는 CPO 대안을 제시한 AI 정렬 연구의 중요한 기여다.
언급 프로젝트
본문 미리보기
arXiv:2605.20834v1 Announce Type: new Abstract: Direct Preference Optimization (DPO) has emerged as a popular alternative to Reinforcement Learning from Human Feedback (RLHF), offering theoretical equivalence with simpler implementation. We prove this equivalence is conditional rather than universal, depending on an implicit assumption frequently violated in practice: the RLHF-optimal policy must prefer human-preferred responses. When this assumption fails, DPO optimizes relative advantage over
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

