온-정책 증류(OPD)와 온-정책 자기증류(OPSD)의 효과를 종합적으로 실증 연구하여 언제 작동하고 실패하는지 원인을 분석합니다. OPD는 수학 추론에서 교사 선택과 손실 공식화에 매우 민감하며, OPSD는 특권 정보가 공유 잠재 규칙일 때만 효과적임을 발견했습니다. 세 가지 실패 메커니즘을 식별하고 그래디언트 중지 TopK, RLVR 적응 교사, SFT 안정화 학생으로 이를 완화할 수 있음을 보였습니다.
- •OPD는 수학 추론에서 교사 선택과 손실 공식화에 매우 민감하며 일관성 없는 결과를 보입니다.
- •OPSD는 특권 정보가 공유 잠재 규칙일 때 효과적이지만 인스턴스별 정보에서는 실패합니다.
- •분포 불일치, 최적화 불안정, OPSD 특이 한계 등 세 가지 실패 메커니즘을 식별했습니다.
- •그래디언트 중지 TopK, RLVR 적응 교사, SFT 안정화 학생으로 주요 실패를 완화할 수 있습니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes
- 1.온폴리시 증류(OPD)와 자기증류(OPSD)의 작동 조건과 실패 원인 종합 경험적 연구
- 2.OPD는 교사 선택과 손실 공식화에 민감하고, OPSD는 인스턴스별 특권 정보 의존 시 실패
- 3.분포 불일치, 최적화 불안정, OPSD 고유 한계 등 세 가지 실패 메커니즘 규명
- 4.stop-gradient TopK 목표, RLVR 적응 교사, SFT 안정화 학생으로 실패 완화 방법 제시
왜 중요한가?
LLM 포스트 트레이닝의 핵심 기법인 온폴리시 증류의 성공·실패 조건을 체계적으로 분석하여, 실무자가 언제 어떤 기법을 적용할지 판단할 수 있는 명확한 지침을 제공한다.
본문 미리보기
arXiv:2605.11182v1 Announce Type: new Abstract: On-policy distillation (OPD) and on-policy self-distillation (OPSD) have emerged as promising post-training methods for large language models, offering dense token-level supervision on trajectories sampled from the model's own policy. However, existing results on their effectiveness remain mixed: while OP(S)D has shown promise in system prompt and knowledge internalization, recent studies also report instability and degradation. In this work, we p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

