AWS·NVIDIA·Heidi Health가 협업해 아마존 EC2 GPU 인스턴스에서 NVIDIA CUDA MPS(Multi-Process Service)와 트라이톤 추론 서버를 결합해 자동 음성 인식(ASR) 추론 인프라를 75% 절감하는 방법을 공개했다. 주당 240만 건의 임상 상담을 처리하는 Heidi Health는 기존 GPU 시분할 방식에서 GPU당 약 62 RPS(초당 요청)에 그쳐 16개 GPU가 필요했으나, MPS로 GPU를 동시 실행 파티션으로 나눠 g7e.4xlarge 인스턴스에서 GPU당 92.1 RPS를 달성해 4개 GPU로 축소했다. 텐서RT·ONNX 최적화까지 더하면 GPU당 111.6 RPS로 88% 절감까지 가능하다. 이 접근법은 트라이톤으로 서빙되는 모든 인코더-디코더 모델에 적용 가능해, 단일 요청이 GPU 자원의 일부만 쓰는 워크로드 전반의 비용 절감에 활용될 수 있다.
- •AWS·NVIDIA·Heidi Health, CUDA MPS+트라이톤으로 ASR 추론 GPU 75% 절감 방법 공개
- •기존 시분할 방식 GPU당 62 RPS→MPS 적용 후 g7e.4xlarge서 92.1 RPS 달성
- •텐서RT+ONNX+MPS 조합 시 GPU당 111.6 RPS, 88% 인프라 절감까지 가능
- •16개 GPU 필요하던 배포를 4개로 축소, 지연시간 SLA(평균<650ms, p99<1000ms) 유지
- •트라이톤 기반 모든 인코더-디코더 모델에 적용 가능한 범용 접근법
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
- 1.AWS·엔비디아·Heidi, CUDA MPS와 Triton으로 ASR 추론 GPU 인프라 75% 절감(16대→4대) 사례 공개
- 2.헤이디 헬스, 주당 240만건 임상상담 처리, g7e.4xlarge서 GPU당 처리량 92.1 RPS로 확대
- 3.TensorRT·ONNX 최적화 결합 시 GPU 88% 절감(2대)까지 가능, RPS 111.6으로 추가 향상
- 4.MPS는 코드 변경 없이 여러 프로세스가 GPU를 동시 공유, 인코더-디코더 모델 전반에 적용 가능
왜 중요한가?
요청당 GPU 활용률이 낮은 음성인식 등 소규모 추론 워크로드에서 하드웨어 비용을 대폭 절감할 수 있는 구체적 기법을 제시해, 실서비스 운영 중인 AI 기업들의 인프라 비용 구조에 실질적 참고가 될 수 있다.
본문 미리보기
Serving automatic speech recognition (ASR) models at scale is costly when each request uses only a fraction of a GPU. Learn how NVIDIA CUDA Multi-Process Service (MPS) with NVIDIA Triton Inference Server on Amazon EC2 GPU instances cuts GPU infrastructure by 75% while holding sub-second latency at 92.1 requests per second per GPU.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
