엔비디아가 LLM 배포·확장과 강화학습 사후학습 과정의 모델 가중치 이동을 최적화하는 소프트웨어 인프라 '모델익스프레스(ModelExPress)'를 24일 발표했다. 모델 규모가 테라바이트급으로 커지면서 새 서버 가동 시 모델 로딩에만 10분 이상 걸리는 '콜드 스타트'가 병목이 됐는데, MX는 새 서버가 외부 저장소 대신 같은 모델을 이미 띄운 옆 서버의 GPU에서 데이터를 직접 전송받도록 해 문제를 해결했다. 800GB급 초대형 모델 기준 서버 준비 시간이 8분 이상에서 1분44초로 줄었고, 서버 간 모델 복사 자체는 10초 미만이다. 앞선 서버의 컴파일·최적화 결과물까지 함께 복사해 반복 작업을 없앴으며, vLLM·SGLang 등 주요 오픈소스 추론 엔진과 즉시 연동된다. 대규모 AI 클러스터 운영 기업의 확장 대기 시간을 크게 줄일 것으로 기대된다.
- •엔비디아, GPU 간 직접 전송으로 LLM 가중치 이동을 최적화하는 '모델익스프레스(MX)' 발표
- •800GB급 모델 기준 서버 준비 시간 8분 이상 → 1분44초로 단축, 서버 간 복사는 10초 미만
- •외부 저장소 대신 이미 가동 중인 이웃 서버 GPU에서 직접 데이터를 받아 콜드 스타트 해소
- •기존 서버의 컴파일·최적화 결과물까지 복사해 반복 최적화 과정 생략, RL 학습-추론 서버 간 전송도 효율화
- •vLLM·SGLang 등 주요 오픈소스 추론 엔진과 즉시 연동
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
엔비디아, LLM 배포 가속 '모델익스프레스' 발표..."서버 대기 8분에서 1분대로 단축"
- 1.엔비디아, LLM 가중치 이동 최적화 인프라 '모델익스프레스(MX)' 발표
- 2.800GB급 모델 서버 가동 8분→1분44초 단축, GPU간 직접 복사는 10초 미만
- 3.외부 저장소 대신 이미 가동 중인 옷 서버 GPU에서 직접 전송해 콜드 스타트 해소
- 4.컴파일 최적화 결과물까지 복사, vLLM·SGLang 등 주요 추론 엔진과 즉시 연동
왜 중요한가?
모델이 TB급으로 커지며 가중치 로딩이 추론 서비스 확장의 새 병목이 된 상황에서, 콜드 스타트를 8분대에서 1분대로 줄이면 트래픽 급증 시 오토스케일링과 RL 사후학습의 학습-추론 서버 동기화가 실질적으로 빨라진다. 대규모 클러스터 운영 비용·응답성에 직접 영향을 주는 인프라 개선이다.
본문 미리보기
대형언어모델(LLM)의 규모가 테라바이트(TB)에 이르면서 모델 가중치를 이동하는 시간이 AI 서비스의 새로운 병목으로 떠오르고 있다. 엔비디아가 이러한 문제를 해결하기 위해 GPU 간 직접 전송 기술을 활용한 새로운 모델 배포 인프라를 공개했다. 엔비디아는 24일(현지시간) LLM의 배포와 확장, 강화학습(RL) 사후학습 과정에서 발생하는 모델 가중치 이동을 최적화하는 소프트웨어 인프라 ‘모델익스프레스(ModelExPress)’를 발표했다.AI 모델의 규모가 테라바이트(TB) 수준으로 커지면서, 새로운 AI 서버를 켤 때마다 모델
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:26AI 초안

