NVIDIA와 Hugging Face가 협력해 NeMo Automodel 오픈소스 라이브러리로 Diffusers 형식 모델을 체크포인트 변환 없이 대규모 분산 파인튜닝할 수 있게 했다. FLUX.1-dev(12B), FLUX.2-dev(32B), Wan 2.1/2.2, HunyuanVideo 1.5, Qwen-Image 등 주요 텍스트-이미지·비디오 모델용 레시피를 제공하며, FSDP2·텐서·파이프라인 병렬화를 코드 수정 없이 YAML 설정만으로 전환할 수 있다. 8×H100 기준 FLUX.1-dev LoRA 학습에서 초당 53.7장 처리 성능을 보였고, 78장 타로 카드 데이터셋으로 200스텝 만에 스타일 특화가 가능함을 시연했다. 대형 확산 모델 파인튜닝의 인프라 장벽을 낮춰 개발자가 도메인 특화 이미지·영상 모델을 쉽게 만들 수 있게 됐다는 점에서 의미가 있다.
- •NeMo Automodel은 Hugging Face Hub의 Diffusers 모델 ID를 그대로 지정해 학습 가능하며, 체크포인트가 변환 없이 DiffusionPipeline으로 왕복 호환됨 (Apache 2.0)
- •FSDP2·텐서·컨텍스트·파이프라인 병렬화를 모델 코드 재작성 없이 YAML 설정 선언만으로 전환하는 구조
- •지원 모델: FLUX.1-dev(12B), FLUX.2-dev(32B), Wan 2.1 T2V(1.3B/14B), Wan 2.2 A14B(MoE 27B), HunyuanVideo 1.5(13B), Qwen-Image(20B)
- •8×H100 벤치마크에서 FLUX.1-dev LoRA r64가 초당 53.73장(스텝당 0.894초), Wan 2.1 1.3B 풀 파인튜닝이 초당 8.5클립 처리
- •풀 파인튜닝과 LoRA PEFT 모두 지원하며, 향후 YAML 외에 완전 타입 지정 Pythonic API 제공 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fine-tune video and image models at scale with NVIDIA NeMo Automodel and 🤗 Diffusers

- 1.NVIDIA·Hugging Face가 NeMo Automodel-Diffusers 통합 공개, 체크포인트 변환 없이 Hub 모델 분산 학습
- 2.FLUX.1-dev·FLUX.2-dev·Wan 2.1/2.2·HunyuanVideo 1.5·Qwen-Image 레시피 제공
- 3.FSDP2·텐서·컨텍스트·파이프라인 병렬을 YAML 설정만으로 전환, 풀 FT와 LoRA 모두 지원
- 4.H100 8장 기준 FLUX.1-dev LoRA 초당 53.7장 처리 등 벤치마크 공개, Apache 2.0
왜 중요한가?
기존에는 대형 확산 모델(12B~32B) 파인튜닝 시 모델별 커스텀 학습 스크립트와 체크포인트 포맷 변환이 필요했지만, 이 통합으로 Hub 모델 ID만 지정하면 단일 GPU부터 멀티노드까지 동일한 워크플로로 학습이 가능해졌다. 결과 체크포인트가 DiffusionPipeline에 바로 로드되므로 영상·이미지 생성 모델의 도메인 특화를 하려는 팀의 진입 장벽이 크게 낮아진다.
엔비디아의 NeMo Automodel과 Hugging Face의 Diffusers를 활용한 대규모 영상 및 이미지 모델 미세조정 소식은 한국 AI 개발자들에게 매우 중요합니다. 국내에서도 고품질 AI 콘텐츠 생성 및 맞춤형 모델 개발 수요가 높은 만큼, 이러한 기술은 효율적인 모델 학습과 서비스 상용화에 필수적인 기반이 될 것입니다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 01:53AI 초안

