LLM 파인튜닝에서 모드 붕괴 문제를 겨냥한 탐색적 강화학습 프레임워크 PPO-HSC가 제안됐다. 검증 가능한 보상 기반 RL(RLVR)은 고보상 궤적만 과도하게 강화해 알려진 풀이에 갇히는 경향이 있는데, PPO-HSC는 '유사도는 낮지만 유효한' 추론 패턴 발견에 보상을 주는 고차 샘플링 커버리지(HSC) 보상을 도입한다. 검증된 고유 해법의 동적 궤적 라이브러리를 유지하면서 의미적 참신성에 미분 가능한 신호를 부여하고, 타당성 제약으로 구조적 합리성을 담보한다. GSM8K·SVAMP 수학 추론과 코드 생성 과제에서 최신 RL 베이스라인의 정확도·문법 무결성을 유지하거나 넘어서면서 해법 다양성과 상태공간 커버리지를 크게 높였다. RLVR 시대에 탐색과 다양성을 회복하는 실용적 처방이다.
- •RLVR의 고보상 궤적 과익 강화가 초래하는 모드 붕괴('보이지 않는 족쇄') 문제를 직접 겨냥
- •'저유사도·고유효성' 추론 패턴 발견을 보상하는 고차 샘플링 커버리지(HSC) 보상 도입
- •검증된 고유 해법의 동적 궤적 라이브러리로 의미적 참신성에 미분 가능 신호 제공
- •GSM8K·SVAMP·코드 생성에서 정확도 유지·초과와 함께 해법 다양성·상태공간 커버리지 향상
PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization
- 1.LLM 파인튜닝의 모드 붕괴 문제를 꺨냥한 탐험형 RL 프레임워크 PPO-HSC 제안
- 2.'유사도 낮지만 유효한' 추론 패턴에 보상을 주는 고차 샘플링 커버리지(HSC) 보상 도입
- 3.검증된 고유 해법의 동적 라이브러리로 의미적 새로움을 미분 가능 신호로 제공
- 4.GSM8K·SVAMP·코드 생성에서 해법 다양성 향상하면서 정확도는 SOTA RL 베이스라인 이상 유지
왜 중요한가?
RLVR이 고보상 경로만 과최적화해 해법 다양성을 잃는 문제는 추론 모델 학습의 알려진 약점인데, 정확도를 희생하지 않고 탐험을 되살리는 보상 설계를 제시해 수학·코딩 RL 학습 레시피 개선에 참고할 만하다.
본문 미리보기
arXiv:2607.16206v1 Announce Type: new Abstract: This paper introduces PPO-HSC (Proximal Policy Optimization with High-order Sampling Coverage), an exploratory reinforcement learning framework designed to address the "Invisible Shackles" of mode collapse in Large Language Model (LLM) fine-tuning. While standard Reinforcement Learning from Verifiable Rewards (RLVR) effectively reinforces high-reward trajectories, it often leads models to over-optimize known solutions, sacrificing curiosity and th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요