RLHF(인간 피드백 강화학습)에서 인간의 인지 편향으로 인한 불완전한 피드백 문제를 해결하는 새로운 방법을 제안합니다. 기존 보상 모델은 합리성 파라미터 베타를 고정 상수로 처리했으나, 실제 인간 판단은 맥락에 따라 인지 편향의 영향을 받습니다. 이 연구에서는 LLM-as-judge를 활용해 인지 편향 가능성을 평가하고 베타를 동적으로 조정함으로써 편향된 비교에 낮은 가중치를 부여합니다. 강한 편향이 포함된 데이터셋으로 미세 조정해도 더 합리적인 다운스트림 모델을 학습할 수 있음을 실험적으로 검증했습니다.
- •RLHF의 보상 모델은 합리성 파라미터 베타를 고정 상수로 가정하지만, 실제 인간 피드백은 맥락 의존적 인지 편향에 의해 왜곡된다.
- •LLM-as-judge를 사용해 인지 편향 존재 가능성을 평가하고, 편향이 의심되는 비교쌍에 낮은 가중치를 부여하도록 베타를 동적으로 조정하는 방법을 제안한다.
- •강한 편향이 있는 선호 데이터셋으로 훈련하더라도 제안 방법은 더 합리적인 하류 모델을 학습시킬 수 있음을 실험적으로 입증했다.
- •이 접근법은 불완전한 인간 피드백에 강건한 모델을 만드는 실용적 방안으로, RLHF 파이프라인의 신뢰성 향상에 기여한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mitigating Cognitive Bias in RLHF by Altering Rationality
- 1.RLHF에서 인간 피드백의 인지 편향을 beta 파라미터를 동적으로 조정해 보정하는 방법 제안
- 2.LLM-as-judge를 활용해 편향된 주석을 자동 감지하고 해당 비교에 낙은 가중치 부여
- 3.맥락및 주석자별로 합리성을 다르게 취급함으로써 더 강건한 보상 모델 학습 가능
- 4.편향된 데이터셋으로 파인튜닝해도 더 합리적인 하위 모델이 학습됨을 실험으로 입증
왜 중요한가?
실제 인간 피드백의 불완전성을 체계적으로 보정하는 접근법으로, RLHF 기반 LLM 정렬의 신뢰성과 품질을 높이는 데 직접적으로 기여한다.
본문 미리보기
arXiv:2605.06895v1 Announce Type: new Abstract: How can we make models robust to even imperfect human feedback? In reinforcement learning from human feedback (RLHF), human preferences over model outputs are used to train a reward model that assigns scalar values to responses. Because these rewards are inferred from pairwise comparisons, this learning depends on an assumed relationship between latent reward differences and observed preferences, typically modeled using a Boltzmann formulation in
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

