아마존웹서비스(AWS)가 세이지메이커 하이퍼팟 추론 게이트웨이를 발표했다. 기존 쿠버네티스 라운드로빈·최소연결 라우팅은 GPU의 KV 캐시 사용률이나 LoRA 어댑터 적재 여부를 파악하지 못해 트래픽 급증 시 첫 토큰 지연시간이 4초 이상으로 치솟는 문제가 있었는데, 이 게이트웨이는 실시간 GPU 신호를 기반으로 요청을 최적의 파드에 배치해 지연시간을 최대 82%까지 줄인다. 엔보이 게이트웨이, 바디 기반 라우터, 엔드포인트 피커로 구성된 2계층 아키텍처를 EKS 관리형 애드온 하나로 설치할 수 있으며 애플리케이션 코드 변경이 필요 없다. AWS 벤치마크에 따르면 혼합 GPU 환경에서 라마-3.1-8B의 P95/P99 지연시간이 각각 97% 줄고 처리량은 8% 늘었으며, Qwen3-32B는 처리량이 50% 증가했다. 1단계 클러스터별 게이트웨이는 현재 이용 가능하며, 다중 클러스터·리전을 아우르는 2단계 '글로벌 추론 라우터'는 추후 출시될 예정이다.
- •AWS, GPU 인식 라우팅 '세이지메이커 하이퍼팟 추론 게이트웨이' 공식 발표
- •실시간 GPU 신호 기반 라우팅으로 첫 토큰 지연시간 최대 82% 감소
- •단일 EKS 관리형 애드온으로 설치, 사이드카·서비스 메시·코드 변경 불필요
- •벤치마크서 라마-3.1-8B 지연 97% 감소, Qwen3-32B 처리량 50% 증가
- •1단계 클러스터별 라우팅 현재 이용 가능, 2단계 '글로벌 추론 라우터'는 추후 출시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Introducing Amazon SageMaker HyperPod Inference Gateway
- 1.아마존, 세이지메이커 하이퍼팟용 쿠버네티스 네이티브 GPU 인지형 라우팅 애드온 '인퍼런스 게이트웨이' 출시
- 2.실시간 GPU 신호(KV캐시·큐 깊이·LoRA 어댑터 상주 등)로 요청 배치, 최초 토큰 지연 최대 82% 감소
- 3.혼합 GPU 세대 환경서 Qwen3-32B TTFT P95/P99 최대 98% 감소, 처리량은 50% 증가
- 4.EKS 매니지드 애드온 설치만으로 코드 변경 없이 적용, vLLM·SGLang·TGI 등 호환 서버 모두 지원
왜 중요한가?
기존 라운드로빈 방식은 GPU 내부 상태를 모른 채 요청을 분산해 지연 급증과 과잉 프로비저닝을 유발했는데, GPU 인지형 라우팅으로 혼합 하드웨어·버스트 트래픽 환경에서도 비용을 줄이면서 응답 속도를 크게 개선할 수 있다.
언급 프로젝트
본문 미리보기
Amazon SageMaker HyperPod Inference Gateway is a Kubernetes-native, GPU-aware routing add-on for Amazon EKS. It uses real-time GPU signals to send each inference request to the best-suited pod, cutting first-token latency by up to 82% with no changes to your model servers or client applications.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

