S2T-RLHF는 RLHF 학습 불안정의 원인인 크레딧 할당 문제를 '문장' 단위 중간 계층으로 해결하는 프레임워크다. 시퀀스 전체에 스칼라 보상 하나만 주는 표준 RLHF는 토큰 단위 업데이트에서 기여도가 모호해지는데, 저자들은 반대로 토큰 단위로 지나치게 세분화하면 노이즈 많은 선호 신호의 불확실성이 증폭돼 오히려 학습이 불안정해진다고 주장한다. 이에 시퀀스 보상을 먼저 문장별로 배분하고 각 문장 안에서만 제한된 토큰 정제를 적용하는 문장→토큰 분해 방식을 제안했으며, 보상 모델 재학습이나 토큰 감독이 필요 없다. 여러 데이터셋과 최적화 설정에서 선호 정렬 성능을 유지하면서 학습 안정성과 강건성이 개선됨을 보였다.
- •'세밀할수록 좋다'는 토큰 단위 보상 정제 가정이 노이즈 환경에서 오히려 학습을 불안정화시킴을 지적
- •의미 일관성과 토큰 노이즈 강건성의 균형점으로 문장을 중간 해상도로 채택
- •시퀀스 보상을 문장별 배분 후 문장 내 제한된 토큰 정제를 적용하는 2단계 분해 구조
- •보상 모델 재학습이나 별도 토큰 단위 감독 데이터 불필요
- •복수 데이터셋·최적화 설정에서 선호 정렬 유지하며 학습 안정성 향상 확인
S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF
본문 미리보기
arXiv:2607.18258v1 Announce Type: new Abstract: Reinforcement learning from human feedback (RLHF) with preference-based reward models often exhibits unstable training dynamics. A key contributing factor is that standard RLHF relies on a single sequence-level scalar reward, which is propagated to token-level policy updates and leaves credit assignment within a response inherently ambiguous. Recent work has attempted to address this issue by refining rewards into denser token-level supervision, o
전체 내용이 궁금하다면?
원문을 직접 읽어보세요