GFT(Group Fine-Tuning)는 SFT와 RL을 단일 프레임워크로 통합한 LLM 사후학습 방법이다. 저자들은 SFT를 극도로 희박한 암묵 보상과 불안정한 역확률 가중을 쓰는 policy gradient의 특수 사례로 해석하고, 이 구조가 단일 경로 의존성·엔트로피 붕괴·그라디언트 폭발을 유발함을 분석한다. GFT는 다양한 응답 그룹을 구성하고 정규화된 대조 감독을 끌어내는 Group Advantage Learning, 역확률 가중을 적응적으로 제한하는 Dynamic Coefficient Rectification 두 메커니즘으로 이 한계를 해결한다. 실험에서 SFT 기반 방법을 일관되게 능가하고 후속 RL 학습과 더 매끄럽게 통합된다.
- •SFT와 RL을 단일 프레임워크로 통합하는 사후학습 방법 GFT
- •SFT의 한계(단일 경로 의존, 엔트로피 붕괴, 그라디언트 폭발) 구조적 분석
- •Group Advantage Learning: 다양한 응답 그룹의 대조 감독으로 보상 희박성 완화
- •Dynamic Coefficient Rectification: 역확률 가중 적응적 제한으로 안정 최적화
- •후속 RL 학습과 더 매끄러운 통합, SFT 기반 방법 일관 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
- 1.SFT와 RL을 정책 그라디언트 관점에서 통합한 새 사후학습 프레임워크
- 2.SFT의 구조적 불안정성 3종을 이론적으로 규명
- 3.그룹 대비 학습 + 계수 정류로 안정성·성능 동시 개선
왜 중요한가?
LLM 사후학습은 SFT→RL 2단계가 표준이지만 둘 사이 전환에서 지식 주입과 일반화가 충돌한다. GFT는 이를 단일 프레임으로 통합해 RL 이전 단계 품질을 끌어올리는 실용적 개선이다.
본문 미리보기
arXiv:2604.14258v1 Announce Type: new Abstract: Large language models are typically post-trained using supervised fine-tuning (SFT) and reinforcement learning (RL), yet effectively unifying efficient knowledge injection with robust generalization remains challenging. In this work, we provide a training-dynamics analysis showing that SFT can be interpreted as a special case of policy gradient optimization with an extremely sparse implicit reward and unstable inverse-probability weighting, which
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 22:30AI 초안

