Fabio Angeletti가 2개 GPU + 무자본으로 이탈리아어 LLM 'Dante-2B'(2.1B 파라미터)를 0부터 학습하는 시리즈의 1편. iGenius Modello Italia(9B Leonardo 슈퍼컴), Fastweb MIIA(7B DGX), Almawave Velvet(Apache 2.0), 대학 Minerva/Cerbero/LLaMAntino 등 기존 이탈리아 AI 생태계 공백 지적 — 인프라 독점 + 영어 기반 파운데이션 파인튜닝이 대부분. Dante-2B 차별점 4가지: (1) 이탈리아어 네이티브 64k BPE 토크나이저 (dell'algoritmo 단일 토큰, è 1토큰), (2) 서버 GPU 2장(각 140GB) 단일 머신 2주 학습, (3) 모든 단계 공개 문서화(실패·버그 포함), (4) 완전 오픈소스 공개. Minerva 1T 이탈리아어 토큰 vs Dante-2B 45B 큐레이션 토큰 — 양보다 '공무원 저널·EU 의회·171k 공공 도서·FineWiki' 같은 품질 기반 선별.
- •Dante-2B 2.1B 파라미터 이탈리아어 LLM, GPU 2장 + 무자본 + 2주로 scratch 학습.
- •이탈리아어 네이티브 토크나이저로 accented 문자·축약형을 1토큰 처리 — 영어 기반 대비 효율 급상승.
- •기존 이탈리아 AI 모델 대부분 LLaMA/Mistral 파인튜닝으로 영어가 밑바탕.
- •Minerva 1T 이탈리아어 vs Dante-2B 45B 큐레이션 — 양보다 품질 전략.
- •코드·가중치·파이프라인 전부 오픈소스 — 재현 가능한 이탈리아 AI 생태계 인프라 구축.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Why I’m Training an Italian Language Model from Scratch — With Two GPUs and No Funding
- 1.Dante-2B = 2GPU + 무자본 이탈리아어 scratch LLM 공개 구축 프로젝트.
- 2.이탈리아어 네이티브 토크나이저가 성능·효율의 핵심 레버.
- 3.기존 이탈리아 AI는 슈퍼컴 접근 독점 또는 영어 모델 파인튜닝.
- 4.45B 큐레이션 토큰이 1T 무작위 크롤보다 효과적이라는 가설.
- 5.엔지니어링 전 과정 오픈 문서화 = 지역 AI 생태계 성장 촉매.
왜 중요한가?
한국어 LLM 개발(업스테이지 Solar, LG Exaone, 네이버 HyperCLOVA) 의사결정에 시사점 크다. 특히 슈퍼컴 없이 2GPU로 한국어 특화 모델을 구축하는 레시피로서 중소 AI 기업·연구실이 즉시 참고 가능. 토크나이저·데이터 큐레이션·오픈소스 공개 3요소가 저자원 언어 생태계 가속기로 작동한다는 명확한 템플릿.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

