검증 가능한 보상을 활용한 강화학습(RLVR)에서 학습 신호 배분이 반복 샘플링 시 접근 가능한 해의 다양성을 좌우한다는 문제의식에서 출발한 'Exploration-Preserving Policy Optimization(ExPPO)'이 제안됐다. 프롬프트별 상대적, 길이 정규화된 응답 서프라이절과 프롬프트 통과율을 이용해 신용 배분을 재조정하는 경량 기법이다. 검증자 극성을 보존하면서 각 프롬프트 그룹의 전체 어드밴티지 총량을 유지하도록 설계됐다. 실험에서 도메인 내외 추론 커버리지와 전체 정답률이 향상됐고, 대규모 샘플링 예산에서도 강한 커버리지와 정답 모드의 다양성 증가를 보였다.
- •프롬프트별 응답 서프라이절과 통과율로 신용 배분을 재조정하는 경량 기법 ExPPO 제안
- •검증자 극성 보존과 프롬프트 그룹별 전체 어드밴트지 총량 유지가 핵심 설계
- •도메인 내외 추론 커버리지와 전체 응답 정답률 향상 확인
- •대규모 샘플링 예산에서도 정답 모드의 다양성과 발견율 증가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Exploration-Preserving Policy Optimization
- 1.검증 가능한 보상 강화학습(RLVR)의 균등 어드밴티지 한계를 보완하는 'ExPPO' 제안
- 2.프롬프트별 길이 정규화 서프라이즈와 통과율로 크레딧을 재분배하는 경량 어드밴티지 조정 규칙
- 3.검증자 극성 보존과 그룹별 절대 어드밴티지 총량 유지를 동시에 달성
- 4.도메인 내·외 추론 커버리지와 응답 정확도 향상, 대규모 샘플링서 강한 커버리지 확인, 코드 공개
왜 중요한가?
강화학습 기반 추론 모델 학습에서 정답을 찾는 것뿐 아니라 다양한 정답 경로를 계속 탐색할 수 있는가도 함께 개선하는 방법으로, 보상 희소성으로 인한 탐색 붕괴 문제에 실용적 해법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2610.04011v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards improves reasoning, while the allocation of learning signal shapes which solutions remain accessible under repeated sampling. Group-relative objectives assign equal advantages to equally rewarded responses, making aggregate credit proportional to sampled mode frequency. We introduce Exploration-Preserving Policy Optimization (ExPPO), a lightweight advantage-shaping rule that redistributes credit using
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

