지도 미세조정(SFT) 데이터 준비 시리즈 1편은 데이터 품질 점검과 포맷팅 기초를 다룬다. 정확성, 다양성, 유사 과제 간 일관성, 중복 제거, 유해성 검사가 핵심 품질 기준으로 제시되며, LIMA 연구는 엄선된 1,000개 예제만으로도 훨씬 큰 데이터셋을 능가할 수 있음을 보였다고 소개한다. 아마존 노바 등 최신 SFT 파이프라인은 JSONL 대화 형식을 사용하며, 추론 모델은 reasoningContent 필드로 사고 과정을 학습 데이터에 포함해야 한다고 설명한다. 원본 모델의 채팅 템플릿을 정확히 따르고 데이터의 10~20%를 평가셋으로 분리해 두는 것이 필수라고 강조한다.
- •LIMA 연구: 엄선된 1,000개 예제만으로도 훨씬 대규모 데이터셋 학습 모델을 능가하는 성능 달성
- •AlpaGasus: 지시 데이터셋을 상위 20% 품질로 필터링하면 전체 데이터보다 더 빠르고 높은 성능
- •아마존 노바 등은 JSONL 대화 형식과 역할 교대 규칙을 엄격히 요구, reasoningContent로 사고 과정 학습 지원
- •원본 모델의 채팅 템플릿을 그대로 따르지 않으면 시스템 프롬프트 무시나 출력 오류 유발 가능
- •데이터의 10~20%를 평가셋으로 반드시 분리해 과적합과 실제 학습 효과를 구분해야 함
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Preparing data for supervised fine-tuning Part 1: Formatting and quality
- 1.AWS 블로그, SFT(지도 미세조정) 데이터 준비 2부작 중 1부로 품질검사·포맷팅·학습·평가 분할 기법 정리
- 2.정확성·다양성·일관성·중복제거·독성검사 5대 데이터 품질 리스트, LIMA·AlpaGasus 등 소량 고품질 사례 인용
- 3.Amazon Nova는 대화형 JSONL 포맷과 Converse API 스키마 사용, 추론모델은 reasoningContent로 사고과정 학습
- 4.평가션은 전체의 10~20%를 홀드아웃, 원본 모델의 챗 템플릿과 정확히 일치시켜야 성능 저하 방지
왜 중요한가?
SFT 성능의 상한선이 모델 구조보다 데이터 준비 품질에 의해 결정된다는 점을 LIMA·AlpaGasus 같은 실증 사례로 보여주며, 파운데이션 모델을 파인튜닝하려는 팀에게 실무적인 품질·포맷 체크리스트를 제공한다.
본문 미리보기
Data preparation determines the ceiling of any supervised fine-tuning project. This first post in a two-part series covers the foundations of SFT data prep: quality checks, conversational (JSONL) formatting, reasoning and tool-calling schemas, and a representative train/evaluation split.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
