SGPO(Strategy-Guided Policy Optimization)는 강한 모델에서 약한 모델로 추론 능력을 증류할 때 특정 풀이 궤적을 모방하는 대신 재사용 가능한 '전략'을 증류하는 프레임워크다. 기존 궤적 수준 모방은 사례별 단계를 암기하게 해 새 문제로의 일반화를 제한한다. SGPO는 강한 모델 응답에서 구조화된 전략 설명을 추출하고, 각 문제마다 자율 궤적과 전략 유도 궤적을 함께 만들어 전략 유무에 따른 행동을 직접 비교한다. '어떻게 증류할지'는 토큰 수준 forward-KL 목적함수로 전략 조건화가 유발한 분포 변화만 선택적으로 전이하고, '언제 증류할지'는 자율 탐색이 부족하면 유도를 강화하고 모델 역량이 커지면 줄이는 적응형 가중치로 조절한다. 두 모델 계열·네 수학 벤치마크에서 SFT·온폴리시 RL·하이브리드 베이스라인을 일관되게 능가했으며 Qwen2.5-7B-Instruct에서 최강 베이스라인 대비 평균 2.2점 향상됐다.
- •구체적 권적 모방 대신 재사용 가능한 전략 증류로 일반화 개선
- •자율 권적과 전략 유도 권적을 비교해 전략의 효과를 분리
- •토큰 수준 forward-KL로 전략 조건화 분포 변화만 선택적 전이
- •적응형 인스턴스 가중치로 모델 역량에 따라 유도 강도 조절
- •4개 수학 벤치마크에서 Qwen2.5-7B-Instruct 기준 최강 베이스라인 대비 평균 2.2점 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
- 1.SGPO: 권적 모방 대신 재사용 가능한 전략 증류로 추론 능력을 강·약 모델 간 전이
- 2.강 모델 응답에서 구조화 전략 기술을 추출, 문제별 자율·전략유도 권적을 구성해 행동 비교
- 3.토큰 단위 forward-KL 목적함수로 전략 조건화의 분포 변화를 선택적 전이, proximal 제약 안정화
- 4.Qwen2.5-7B-Instruct에서 최강 기준 대비 평균 2.2점 향상, SFT·온폴리시 RL 능가
왜 중요한가?
특정 풀이 궤적을 모방하면 인스턴스별 단계 암기에 그쳐 새 문제 일반화가 제한되는 증류의 한계를, 전이 가능한 전략 단위 증류와 능력에 따라 강도를 조절하는 적응 가중으로 극복한다.
언급 프로젝트
대규모 언어 모델(LLM)이 단순히 특정 답변을 모방하는 것을 넘어, '사고하는 방식'을 학습하도록 유도하는 이 연구는 LLM 성능 향상의 새로운 방향을 제시합니다. 국내에서도 자체 LLM 개발과 응용에 박차를 가하고 있는 만큼, 모델의 단순 암기 문제를 극복하고 실제 추론 능력을 강화하는 기술은 매우 중요합니다. 이는 한국형 LLM의 경쟁력 확보에 핵심적인 기술이 될 수 있습니다.
본문 미리보기
arXiv:2606.24064v1 Announce Type: new Abstract: Distilling reasoning capabilities from strong to weak language models typically involves imitating specific solution trajectories, effectively transferring what to answer rather than how to reason. This trajectory-level imitation encourages memorization of instance-specific steps rather than acquisition of transferable problem-solving skills, limiting generalization to novel problems. We propose Strategy-Guided Policy Optimization (SGPO), which re
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:55AI 초안

