이 글은 지도 미세조정(SFT) 데이터 준비의 심화 전략 4가지, 즉 학습 곡선 기반 데이터 준비도 평가, 데이터 부분집합 선택·필터링, 데이터 증강, 데이터 믹싱을 다룬다. 체크포인트별 성능을 평가해 데이터를 두 배로 늘려도 개선폭이 1~2%포인트 미만이면 포화 지점으로 보고 추가 수집보다 부분집합 정제나 실패 사례 타깃 수집이 낫다고 제안한다. '데이터 반복이 스케일링을 이긴다' 연구는 400개 예제를 128 에폭 학습한 모델이 51,200개 예제를 1에폭 학습한 모델보다 AIME·GPQA에서 12~26%포인트 앞섰다고 밝힌다. 데이터 믹싱은 목표 과제 성능을 높이기보다 일반 능력 손실(치명적 망각)을 막는 보험 성격이 강하다고 설명한다.
- •학습 곡선 분석: 체크포인트별 성능을 도식화해 데이터를 두 배로 늘려도 1~2%p 미만 개선이면 포화로 판단
- •AlpaGasus 등 연구는 상위 20% 품질 데이터만 골라 학습하면 전체 데이터셋보다 빠르고 성능도 높다고 보고
- •'데이터 반복이 스케일링을 이긴다': 400개 예제 128에폭 학습이 51,200개 예제 1에폭 학습을 12~26%p 앞섬
- •데이터 믹싱은 목표 과제 성능 향상용이 아니라 일반 능력의 치명적 망각을 막는 보험 성격
- •Qwen2.5-Coder는 코드:텍스트:수학 70:20:10 비율이 코드 100% 학습보다 코딩 벤치마크에서도 더 우수
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Preparing data for supervised fine-tuning Part 2: Advanced data strategies
- 1.AWS 블로그 SFT 데이터 준비 2부작 중 2부, 데이터 적정량 판단·서브셋 선택·증강·믹싱 등 고급 전략 다룸
- 2.학습곱선 분석으로 데이터 포화점 진단, 소량 반복학습이 대량 1회학습보다 AIME서 12~26%p 우위(연구 인용)
- 3.DEITA·AlpaGasus 등 서브셋 선택 기법으로 상위 20% 품질 데이터만 써도 전체 학습보다 우수한 성능
- 4.데이터 믹싱은 목표 과제 성능 향상이 아닌 일반 능력 보존용, Nova 실험에선 50대50 비율이 균형점
왜 중요한가?
SFT는 사전학습과 달리 데이터량에 비례해 성능이 늘지 않으며, 학습곡선 분석·서브셋 선택·데이터 믹싱을 실증적으로 측정해야 적은 컴퓨팅으로도 더 나은 모델을 만들 수 있음을 보여준다.
본문 미리보기
The advanced side of supervised fine-tuning data prep. This second post in a two-part series covers evaluating data readiness with learning curves, selecting high-value data subsets, augmenting data with synthetic and distilled examples, and mixing data sources to prevent catastrophic forgetting.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
