판 이력 — Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models | AIChainDay