한국어 요약by Claude · 2026. 9. 6.
허깅페이스와 리퀴드AI 연구진이 3억5000만 매개변수 모델 LFM2.5-350M을 GRPO(그룹 상대 정책 최적화)로 미세조정해 구조화 출력 성능을 끌어올리는 방법을 공개했다. TRL 라이브러리로 약 500개 샘플, 100스텝만 학습시켜 IFStruct 벤치마크 점수를 22.6%에서 29.7%로 끌어올렸으며, 특히 JSON 형식 정확도는 18.0%에서 31.9%로 크게 개선됐다. LoRA로 전체 파라미터의 약 1.66%(600만 개)만 학습시켰고, JSON 형식 준수·필드 개수 일치·스키마 검증이라는 세 가지 보상 함수를 가중합해 사용했다. 무료 등급 Colab이나 Kaggle GPU에서도 재현 가능한 저비용 절차로, 소형 모델도 과제 특화 강화학습을 거치면 훨씬 큰 모델의 성능에 근접할 수 있음을 보여준다.
- •LFM2.5-350M을 GRPO로 미세조정, IFStruct 벤치마크 22.6%→29.7% 향상
- •JSON 형식 정확도 18.0%→31.9%로 가장 큰 개선폭 기록
- •LoRA로 전체 파라미터의 1.66%(약 600만개)만 학습, 500샘플·100스텝 소규모 학습
- •JSON 형식·필드개수·스키마검증 3종 보상함수 가중합으로 GRPO 학습
- •무료 Colab/Kaggle GPU에서도 재현 가능, 소형 모델의 대형 모델 근접 성능 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
출처:HuggingFace Blog
AI 인사이트
개발자
- 1.LFM2.5-350M을 TRL GRPO로 500샘플·100스텝 학습해 IFStruct 벤치마크 22.6%→29.7% 개선
- 2.JSON 형식 준수율이 18.0%→31.9%로 최대 상승, YAML은 27.2%→27.5%로 거의 변화 없음
- 3.json_format·field_count·schema_validation 3개 보상 가중합, LoRA로 전체의 1.66%만 학습
- 4.무료 등급 Colab/Kaggle GPU로 재현 가능, Qwen3.5-2B(33.15%)와 격차를 상당히 좁힘
왜 중요한가?
저비용·소규모 미세조정만으로 하위 시스템 연동의 성패를 가르는 구조화 출력 성능을 크게 끌어올릴 수 있음을 보여줘, 소형 모델을 실제 파이프라인에 투입하는 실용적 경로를 제시한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
공유:
#GRPO#파인튜닝#구조화출력#강화학습
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
