NVIDIA가 Nemotron 사전학습용 '태스크 시드 합성 Q&A 생성' 워크플로를 공개했다. lm-eval-harness의 약 70개 공개 태스크(약 700개 서브태스크) 학습 split을 능력 '시드'로 삼아, 표면 형식을 외우게 하는 대신 유사 질문과 추론·지식을 덧붙인 답변 강화 예제를 생성·필터링한다. 핵심은 태스크 패밀리 간 전이학습으로, 과학 QA 시드가 상식 추론을, 논리 추론 시드가 대안 비교 능력을 키우는 식이다. Nemotron-3 Nano에 100B 토큰 연속 학습 실험에서 MMLU-Pro +1.8, 평균 코드 +1.9, 상식 이해 +1.6, GPQA +11.1을 얻었고 평균 수학은 안정적으로 유지됐다. 답변에 맥락·추론을 더한 변형이 라벨만 있는 경우보다 일관되게 높은 성능을 보였다.
- •lm-eval-harness 약 70개 태스크(700개 서브태스크) 학습 split을 시드로 사용, 테스트 데이터는 생성에서 제외
- •수집→정규화→유사 예제 생성→답변 강화→필터링 5단계 파이프라인으로 태스크 구조 예제 생성
- •태스크 패밀리 간 전이학습 관점—넓은 시드 커버리지로 재사용 가능한 추론·지식활용 행동 강화
- •Nemotron-3 Nano 100B 토큰 실험에서 MMLU-Pro +1.8, 코드 +1.9, 상식 +1.6, GPQA +11.1, 수학은 안정 유지
- •답변에 맥락·추론 트레이스를 더한 변형이 라벨만 제공한 경우보다 GPQA·AGIEval 등에서 큰 폭 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Task-Seeded Synthetic Q&A Generation for Nemotron Pretraining
- 1.가상 Q&A 데이터 생성
- 2.Nemotron 사전 학습
- 3.AI 모델 훈련 개선
왜 중요한가?
고품질 합성 데이터 생성은 수동 라벨링 의존도를 줄여 AI 모델 사전 학습의 확장성과 효율성을 높이는 데 기여합니다.
언급 프로젝트
네모트론 사전 학습을 위한 '태스크 기반 합성 질의응답 생성' 기술은 고품질 학습 데이터 확보가 어려운 국내 대규모 언어 모델 개발에 중요한 돌파구가 될 수 있습니다. 한국어 특화 LLM의 성능 향상을 위해 양질의 데이터를 효율적으로 생성하는 능력은 필수적이며, 이는 국내 AI 기업들의 모델 개발 비용 절감과 경쟁력 강화에 직접적으로 기여할 것입니다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 21:45AI 초안

