언어 모델의 강화학습(RL) 효과가 RL 훈련 전·중에 사용되는 데이터의 특성과 다양성에 크게 의존한다는 문제를 다룬 연구다. 조지 폴리아의 문제 해결 접근법에 기반한 부트스트랩 데이터 생성 프레임워크로 각 훈련 문제에 대한 다양한 정답 변형을 생성하는 중간 훈련 단계를 도입했다. 이 중간 훈련으로 초기화된 RL 모델은 다양한 수학적 추론 벤치마크뿐 아니라 코드 생성, 내러티브 추론 등 분포 외 작업에서도 일관된 성능 향상을 보여주었다.
- •RL 이전 중간 훈련 단계에서 자기 생성 다양 데이터를 사용하면 RL 효과가 크게 향상된다
- •폴리아의 문제 해결 접근법을 기반으로 각 문제에 대한 다양한 정답 변형을 생성한다
- •수학적 추론뿐 아니라 코드 생성, 내러티브 추론 등 분포 외 작업에서도 개선이 확인되었다
- •다양한 문제 해결 접근법 학습이 이후 강화학습을 촉진한다는 이론적 근거도 함께 제시한다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
- 1.RL 훈련 전 중간 훈련 단계에서 자기 생성 다양한 데이터를 활용하면 RL 효과가 향상됨을 실증
- 2.Polya 문제 해결 접근법 기반 부트스트랩 데이터 생성으로 동일 문제에 다양한 정답 경로 학습
- 3.수학 추론 벤치마크뿐 아니라 코드 생성, 서사 추론 등 OOD 작업에서도 일관된 성능 향상 확인
왜 중요한가?
LLM 강화학습의 효율을 높이는 실용적 방법을 제시하며, 다양한 문제 해결 전략 사전 학습이 범용 추론 능력 향상에 핵심임을 이론과 실험으로 동시에 증명한다.
본문 미리보기
arXiv:2605.08472v1 Announce Type: new Abstract: The effectiveness of Reinforcement Learning (RL) in Large Language Models (LLMs) depends on the nature and diversity of the data used before and during RL. In particular, reasoning problems can often be approached in multiple ways that rely on different forms of reasoning, and exposure to only a limited range of such approaches in the training data may limit the effectiveness of RL. Motivated by this, we investigate using diverse self-generated da
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

