BV-Blend는 검증 가능한 보상 기반 크리틱-프리 강화학습(RLVR)의 어드밴티지 추정 불안정성을 완화하는 프레임워크다. GRPO 같은 방식은 가치함수를 훈련하지 않아 메모리·연산을 아끼지만, 프롬프트 그룹 내 보상 통계에 의존해 한 그룹의 모든 롤아웃이 동일 보상을 받으면 그룹 내 분산이 0이 되고 어드밴티지도 0이 돼, 이진 검증기의 콜드스타트 학습이 막힌다. BV-Blend는 프롬프트-로컬 온-폴리시 통계와 의미 클러스터별 과거 모멘트를 결합해 이를 안정화한다. 클러스터마다 EMA로 보상 모멘트를 추적하고, 평균의 표준오차(SEM) 프록시에서 신뢰 가중치를 도출해 과거와 로컬 베이스라인·분산 통계를 혼합, PPO식 클리핑 업데이트용 표준화 어드밴티지를 만든다. 검증 가능한 추론 벤치마크 실험에서 훈련 안정성과 성능이 개선됐고, 그룹 정규화 방식이 정체되는 구간에서도 견고했다.
- •GRPO의 그룹 내 분산 0 문제(동일 보상 시 어드밴티지 0)로 인한 콜드스타트 학습 정체 해결
- •프롬프트-로컬 통계와 의미 클러스터별 과거 모멘트를 결합해 어드밴티지 추정 안정화
- •클러스터별 EMA 보상 모멘트 + SEM 기반 신뢰 가중치로 과거·로컬 통계 혼합
- •검증 가능 추론 벤치마크에서 훈련 안정성·성능 개선, 그룹 정규화 정체 구간에서도 견고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards
- 1.BV-Blend 제안: GRPO의 불안정한 프롬프트-지역 어드밴티지 추정을 안정화하는 critic-free RLVR 프레임워크
- 2.그룹 내 보상이 모두 같으면 어드밴티지가 0이 돼 학습이 멈추는 콜드스타트 문제를 직접 겨냥
- 3.의미 클러스터별 EMA 보상 통계를 유지하고 SEM 기반 신뢰 가중치로 과거-현재 통계를 혼합
- 4.검증 가능 추론 벤치마크에서 훈련 안정성·성능 개선, 그룹 정규화 기법이 멈추는 구간에서도 강건
왜 중요한가?
DeepSeek-R1 이후 표준이 된 GRPO식 RLVR의 알려진 약점(제로 분산 그룹에서 학습 정지)을 크리틱 재도입 없이 과거 통계 혼합으로 푸는 실용적 개선이다. 이진 검증기 기반 콜드스타트 훈련이 흔한 추론 모델 학습 파이프라인에 바로 적용할 만하다.
본문 미리보기
arXiv:2606.28707v1 Announce Type: new Abstract: Critic-free reinforcement learning with verifiable rewards (RLVR), exemplified by Group Relative Policy Optimization (GRPO), avoids training a value function (critic) and reduces memory and compute overhead relative to critic-based PPO pipelines for aligning large language models. However, GRPO-style advantage estimation depends on prompt-local (within-prompt-group) reward statistics and can be unstable. In particular, when all rollouts in a promp
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

