이 연구는 강화학습(RL)으로 훈련된 추론 모델이 지도 미세조정(SFT) 모델보다 수학적 문제 해결에서 뛰어난 이유를 내부 표현 구조 분석을 통해 밝혔다. 레이어별 은닉 상태에 대한 선형 프로브 실험에서 RL 모델은 정답 정확도를 예측하는 데 더 높은 정확도를 보여 선형적으로 더 잘 분리된 표현을 갖는 것으로 나타났으며, 평균 절제(ablation) 실험에서는 RL 모델이 깊은 레이어일수록 중요도가 커지는 계층적 구조를 보인 반면 SFT 모델은 레이어 전반에 중요도가 균등하게 분산됐다. 반복 샘플링에서의 토큰 수 변동성 분석 결과, 토큰 할당 방식은 RL과 SFT 여부보다 전체 학습 파이프라인에 더 의존하는 것으로 나타났다. 이는 RL 훈련이 모델의 추론 문제 표현 방식을 근본적으로 재구성한다는 것을 시사한다.
- •선형 프로브 분석: RL 모델이 SFT 모델보다 정답 정확도 예측에서 더 높은 정확도, 더 분리된 표현 보유
- •평균 절제 실험: RL 모델은 깊은 레이어일수록 중요도 증가하는 계층 구조, SFT는 균등 분산
- •반복 샘플링 토큰 수 변동성은 RL·SFT 구분보다 전체 학습 파이프라인에 더 의존
- •RL 훈련이 모델의 추론 문제 내부 표현 방식을 근본적으로 재구성한다는 결론
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
본문 미리보기
arXiv:2607.26119v1 Announce Type: new Abstract: Large reasoning models trained via reinforcement learning (RL) have been increasingly shown to outperform their supervised fine-tuned (SFT) counterparts on mathematical reasoning tasks; Yet the mechanistic basis for this advantage remains unclear. We therefore ask, what internal representational differences enable RL models' superior performance? Our work presents two converging lines of evidence: First, linear probes trained on layer-wise hidden
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

