개인화된 선호 최적화에서 선호 쌍 선택이 단순한 전처리가 아니라 최적화 기하학의 핵심 요소라는 것을 밝혔다. 기대 사용자 효용의 기울기와 DPO 업데이트 방향 간 상호작용을 분석해, 선호 마진이 효용 기울기와 방향적으로 일치할 때 DPO 업데이트가 단순 오류 교정 신호에서 강화학습과 유사한 신호로 전환된다는 사실을 발견했다. 이 통찰을 바탕으로 효용 인식 기하 정렬 쌍 선택과 에폭 단위 재생성을 결합한 반복 알고리즘 GAP-DPO를 제안했다. 개인화된 텍스트 생성 벤치마크에서 GAP-DPO는 표준 DPO 변형들에 비해 문체 충실도, 선호 정렬, 생성 품질을 일관되게 향상시켰다.
- •기대 사용자 효용 기울기와 DPO 업데이트 방향의 일치 여부가 개인화 성능을 좌우한다는 이론적 분석 제시
- •선호 마진이 효용 기울기와 정렬될 때 DPO가 오류 교정에서 강화학습형 신호로 전환됨을 규명
- •효용 인식 기하 정렬 쌍 선택과 에폭 단위 재생성을 결합한 GAP-DPO 알고리즘 제안
- •개인화된 텍스트 생성 벤치마크에서 표준 DPO 변형 대비 문체 충실도·정렬·품질 모두 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Gradient-Aligned Pair Selection for Personalized Preference Optimization
- 1.개인화 선호 학습에서 DPO 쌍 선택을 사용자 효용 기울기와 정렬시키는 GAP-DPO 제안
- 2.오프폴리시 샘플링 시 DPO 업데이트가 오류 교정형에서 강화형으로 전환되는 조건을 기울기 분석으로 규명
- 3.쌍 선택을 기하학적 결정으로 재정의, 선택 방식이 개인화 성패를 가른다는 점을 제시
- 4.개인화 텍스트 생성 벤치마크에서 표준 DPO 대비 스타일 충실도·선호 정렬·생성 품질 모두 개선
왜 중요한가?
개인화 LLM 튜닝에서 흔히 쓰는 휴리스틱 선호쌍 선택이 오히려 개인화를 해칠 수 있음을 보여, DPO 기반 개인화 파이프라인 설계에 실질적 개선 방향을 제공한다.
본문 미리보기
arXiv:2610.00061v1 Announce Type: new Abstract: Personalizing large language models (LLMs) requires aligning generation behavior with user-specific preferences rather than aggregate quality. While Direct Preference Optimization (DPO) provides a stable framework for preference learning, its effectiveness in personalized settings critically depends on how preference pairs are selected. Existing approaches typically rely on heuristic criteria, such as likelihood-based extremes, which decouple opti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

