LLM 사후 훈련에서 SFT를 '모방', RL을 '발견'으로 단순 구분하는 시각의 한계를 지적하고, '역량 유발'과 '역량 창조'를 구분하는 새로운 프레임워크를 제안한다. 역량 유발은 모델이 이미 접근 가능한 행동의 확률을 높이는 것이고, 역량 창조는 접근 가능한 행동 공간 자체를 확장하는 것이다. 자유 에너지 관점에서 SFT와 RL 모두 기반 모델 분포의 재가중치로 볼 수 있으며, 핵심 질문은 SFT냐 RL이냐가 아니라 기존 도달 가능한 행동을 재가중치하는지 아니면 행동 공간을 확장하는지임을 논한다.
- •사후 훈련을 SFT(모방) vs RL(발견)로 구분하는 기존 시각은 지나치게 단순하다
- •역량 유발은 접근 가능한 행동의 확률 증가, 역량 창조는 접근 가능한 행동 공간 자체를 확장한다
- •자유 에너지 관점에서 SFT와 RL 모두 기반 모델 분포의 재가중치 과정으로 볼 수 있다
- •역량 창조는 검색, 상호작용, 도구 사용, 새 정보 통합 등을 통해 달성될 수 있다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective
- 1.SFT를 '모방', RL을 '발견'으로 구분하는 기존 이분법은 지나치게 단순하다는 논증 제시
- 2.접근 가능한 지지 집합 개념으로 능력 유도(reweighting)와 능력 창조(support 확장)를 조작적으로 구분
- 3.자유 에너지 관점에서 SFT와 RL 모두 사전 훈련 참조 분포를 재가중하는 것으로 통합 설명
왜 중요한가?
LLM 포스트 트레이닝의 실제 효과를 이론적으로 명확히 분류하여, 안전성과 능력 연구의 방향을 보다 정밀하게 설정하는 데 기여하는 개념적 프레임워크를 제공한다.
본문 미리보기
arXiv:2605.08368v1 Announce Type: new Abstract: Debates about large language model post-training often treat supervised fine-tuning (SFT) as imitation and reinforcement learning (RL) as discovery. But this distinction is too coarse. What matters is whether a training procedure increases the probability of behaviors the pretrained model could already produce, or whether it changes what the model can practically reach. We argue that post-training research should distinguish between capability eli
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

