문샷 AI가 2026년 7월 27일 공개한 2.8조 파라미터 규모의 전문가 혼합(MoE) 모델 '키미 K3'를 AWS에서 서빙하는 두 가지 방법을 소개하는 가이드다. 키미 K3는 896개 전문가 중 토큰당 16개만 활성화해 약 1040억 파라미터만 실제 연산에 사용하는 구조로, 이전 모델 키미 K2 대비 2.5배의 확장 효율을 달성했다. 모델 가중치는 허깅페이스에 MXFP4(4비트) 포맷으로 공개돼 있으며, vLLM 전용 추론 컨테이너와 엔비디아 B300 GPU 8개를 탑재한 p6-b300 인스턴스로 서빙한다. 아마존 세이지메이커 하이퍼팟의 Inference Operator를 이용한 관리형 배포와, 아마존 EKS에 캐퍼시티 블록을 예약해 자체 관리하는 배포 두 경로를 각각 단계별로 안내한다.
- •문샷 AI, 2.8조 파라미터 MoE 모델 '키미 K3' 공개(토큰당 16개 전문가·약 1040억 파라미터 활성화)
- •키미 K2 대비 2.5배 확장 효율, 100만 토큰 컸텍스트와 네이티브 멀티모달 지원
- •MXFP4(4비트) 양자화 가중치를 허깅페이스에서 제공, vLLM 전용 컨테이너로 서빙
- •세이지메이커 하이퍼팀(관리형)과 EKS+캐퍼시티 블록(자체 관리) 두 가지 배포 경로 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Deploying Kimi K3 on AWS
본문 미리보기
This post walks through deploying Kimi K3 on AWS using two approaches: Amazon SageMaker HyperPod, and Amazon Elastic Kubernetes Service (Amazon EKS) cluster.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:05AI 초안

