선호 기반 사후학습에서 인간 선호 라벨은 완성문 추가 생성보다 훨씬 비싸므로, 같은 라벨링 예산으로 더 많은 완성문 풀을 만들되 가장 정보적인 비교쌍만 라벨링하는 전략이 유리하다. 본 논문은 어떤 쌍을 비교해야 하는지를 표본설계(sampling-design) 문제로 정식화하고, 선호 기반 사후학습 목적함수 하 최종 정책 품질로 설계를 평가한다. 직접선호최적화(DPO)에 이 틀을 적용해 라벨 쌍 선택이 학습을 거쳐 정책 성능으로 전파되는 과정을 분석했으며, DPO 학습 정책의 최적성 격차에 대한 상·하한이 일치함을 증명한다. 이 한계는 비교 선택이 단일 설계 의존 정보 행렬을 통해 파라미터 추정 오차와 정책 준최적성에 연결됨을 보여, 예산 제약 비교 큐레이션의 명시적 최적화 기준을 도출한다. 합성·언어모델 사후학습 벤치마크 실험에서 제안 설계가 통상 휴리스틱보다 표본 효율을 일관되게 높였다.
- •더 큰 완성문 풀에서 정보적인 비교쌍만 라벨링하는 표본설계 문제로 정식화
- •DPO 학습 정책의 최적성 격차에 대한 일치하는 상·하한 증명
- •비교 선택이 단일 설계 의존 정보 행렬을 통해 추정 오차·정책 준최적성에 연결
- •합성·언어모델 벤치마크에서 기존 휴리스틱보다 표본 효율 일관 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Which Pairs to Compare for LLM Post-Training?
- 1.선호 기반 사후학습에서 어떤 비교쌍에 라벨을 달지를 표본 설계 문제로 정식화
- 2.DPO에 적용, 라벨 쌍 선택이 다운스트림 정책 성능으로 전파되는 방식 분석
- 3.사후학습 최적성 격차의 정합 상·하한 도출, 단일 정보 행렬로 연결
- 4.예산 제약 비교 큐레이션 기준 제시, 실험에서 샘플 효율 일관 개선
왜 중요한가?
인간 선호 라벨이 추가 생성보다 훨씬 비싸다는 현실을 전제로, 더 큰 완성 풀에서 가장 정보량이 큰 쌍만 라벨링하는 전략의 효과를 이론적 상·하한과 실험으로 입증해 라벨 예산 활용을 최적화한다.
언급 프로젝트
LLM 성능 향상의 핵심인 선호도 기반 후처리 학습 방식 최적화에 대한 연구는 국내 LLM 개발사들에게 매우 중요합니다. 효율적인 데이터 쌍 선택은 고품질의 한국어 LLM을 더 빠르고 저렴하게 개발하는 데 기여하며, 이는 국내 AI 경쟁력 강화에 직결됩니다.
본문 미리보기
arXiv:2606.19607v1 Announce Type: new Abstract: Preference-based post-training has become a central paradigm for aligning language models. A common data-collection strategy is to generate a small set of completions for each prompt and label the resulting comparison pairs. However, human preference labels are often much more expensive than generating additional completions, suggesting a different use of the same labeling budget: generate a larger pool of completions, but label only the most info
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:55AI 초안

