AWS가 Qwen3-Coder-30B와 NVIDIA Nemotron-3-Nano-30B 두 개의 30B 규모 MoE 모델을 SageMaker AI의 G5·G6·G6e·G7 GPU 인스턴스에서 벤치마크했다. Qwen3-Coder 실험에서 신형 블랙웰 기반 G7은 GPU 2개(64GB)만으로도 초당 391.3 출력 토큰을 처리해 G6 대비 60.8%, G5 대비 13% 높은 처리량과 P99 지연시간 최대 54.7% 감소를 기록했다. Nemotron-3-Nano 실험에서는 SageMaker AI 생성형 AI 추론 추천 기능으로 처리량·비용 최적 구성을 자동 탐색한 결과, G7이 G6 대비 토큰당 비용을 최대 5.6배, G6e 대비 약 1.4배 절감했다. G7의 우위는 블랙웰 GPU의 네이티브 FP4(NVFP4) 텐서코어 지원과 높은 메모리 대역폭이 MoE 모델의 디코딩 병목을 줄이기 때문으로 분석된다.
- •Qwen3-Coder-30B 벤치마크: G7이 GPU 2개(64GB)만으로 G6 대비 처리량 60.8%↑, P99 지연 54.7%↓
- •G7은 블랙웰 GPU 네이티브 FP4(NVFP4) 텐서코어 지원으로 MoE 모델 디코딩 병목 완화
- •Nemotron-3-Nano-30B 추론 추천 결과, G7이 G6 대비 토큰당 비용 최대 5.6배, G6e 대비 1.4배 절감
- •채팅 워크로드는 g7.2xlarge가 100만 토큰당 $0.90로 최저비용, g7.48xlarge가 최고처리량(2,397 tok/s)
- •결과는 테스트된 모델·워크로드·리전에 한정되며, 실제 배포 전 자사 워크로드로 재벤치마킹 권장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6
- 1.G7(Blackwell) 인스턴스, Qwen3-Coder-30B 추론서 G6 대비 처리량 60.8%↑ G5 대비 13%↑
- 2.G7은 GPU 2개·64GB로 G5/G6의 GPU 4개·96GB보다 우수, NVFP4 네이티브 지원이 핵심
- 3.Nemotron-3-Nano-30B 워크로드서 G7은 G6e 대비 토큰당 비용 약 1.4배, G6 대비 최대 5.6배 저렴
- 4.G7 스트리밍 벤치마크 TTFT 118.9ms·ITL 8.9ms로 대화형 코딩 어시스턴트에 적합
왜 중요한가?
MoE 모델 추론에서 GPU 세대 교체가 비용·지연시간에 미치는 영향을 실측 수치로 제시해, 프로덕션 LLM 배포 인스턴스 선택에 직접 참고할 수 있는 벤치마크다.
본문 미리보기
Benchmark two 30B Mixture-of-Experts models, Qwen3-Coder-30B and NVIDIA Nemotron-3-Nano-30B, across G5, G6, G6e, and G7 GPU instances on Amazon SageMaker AI. Compare throughput, latency, and cost-per-token, and see how G7's NVIDIA Blackwell GPUs deliver measurable price-performance gains for real-time LLM inference.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

