Fabio Angeletti의 Dante-2B(이탈리아어 scratch LLM) 시리즈 2편 — 450B 토큰 훈련 코퍼스 조립 과정. 이탈리아어 45% + 영어 45% + 코드 10% 비율. 10개 데이터셋: FineWeb-2 Italian(150B), Cleaned mC4 Italian(50B), Italian-PD(171k 공공 도서 32B), Gazzetta Ufficiale(5B), FineWiki/FinePDFs/EuroParl, FineWeb-Edu(100B), StarCoderData(40B) 등. 3대 실패 사례: (1) Italian-PD 스트리밍 API 고장 + Parquet 컬럼명 불일치('text'/'content'/'body'), (2) EuroParl 중첩 text 필드, (3) StarCoderData 'content' 필드 누락으로 코드 0 토큰 먹통. 3단계 품질 티어(T1 교육·T2 웹·T3 벌크)로 훈련 시 가중 샘플링. 원자 파일 쓰기(.tmp→rename)·shard 체크포인트·재개 가능 설계로 크래시 방지. 언어별 char/token 비율(IT 3.3·EN 4.0·Code 2.8)로 토큰 추정 정확도 확보.
- •Dante-2B 450B 토큰 코퍼스 — 이탈리아어 45% / 영어 45% / 코드 10%.
- •10개 데이터셋 조립 — FineWeb-2 IT(150B)가 최대, Gazzetta Ufficiale·EuroParl·Italian-PD 특화.
- •3대 실패: Italian-PD 스트리밍 고장·EuroParl 중첩 필드·StarCoderData 'content' 필드 누락.
- •3단계 품질 티어(T1 교육·T2 웹·T3 벌크)로 훈련 시 가중 샘플링.
- •원자 파일 쓰기(.tmp→rename) + shard 체크포인트로 3~5일 다운로드 재개 가능.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Assembling 450 Billion Tokens: The Training Data Nobody Had Ready
- 1.Dante-2B 이탈리아어 LLM 훈련 450B 토큰 코퍼스 조립 엔지니어링.
- 2.10개 데이터셋 3대 실패: 스트리밍 API·중첩 필드·필드명 불일치.
- 3.3단계 품질 티어로 훈련 가중 샘플링 + 디버깅 가시성.
- 4.원자 쓰기·shard 체크포인트로 크래시 복구 자동화.
- 5.언어별 char/token 비율(IT 3.3·EN 4.0·Code 2.8)로 예산 추정 정확도.
왜 중요한가?
한국어 LLM 개발팀(업스테이지·LG·네이버 포함)이 scratch 모델 코퍼스 조립 시 직접 적용 가능한 실무 레시피. 특히 이탈리아어와 한국어 모두 'English 외 주요 언어'라 파일 포맷·스트리밍 API 문제·품질 티어링 등 동일 문제 겪음. Atomic write + shard 체크포인트 패턴은 모든 대규모 데이터 파이프라인에 일반화 가능.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:34AI 초안

