AWS는 Amazon SageMaker HyperPod에서 GPU-CPU-공유 NVMe 3단계로 구성된 계층형 KV 캐시 아키텍처를 소개했다. HyperPod의 Managed Tiered KV Cache와 Intelligent Routing에, 경량 분산 캐시 파일시스템 Curvine을 공유 L2 계층으로 결합해 여러 vLLM 복제본이 KV 캐시를 로컬 디스크에 가까운 속도로 재사용할 수 있게 했다. 테스트에서 복제본 간(cross-Pod) 캐시 적중률 최대 100%, TTFT(첫 토큰까지 시간)는 최대 2.7배 개선됐고, 약 1,900토큰 프롬프트 기준 노드 간 L2 읽기 지연은 약 56ms였다. 이를 통해 기존에 P5 인스턴스가 필요하던 워크로드를 더 저렴한 G6e 인스턴스에서 실행할 수 있어 엔드포인트당 비용을 절감할 수 있다.
- •L0(GPU HBM)·L1(CPU 메모리, LMCache)·L2(Curvine 공유 NVMe) 3단계 캐시 계층을 구성했다.
- •여러 vLLM Pod가 FUSE로 마운트된 동일 네임스페이스를 공유해 캐시를 상호 재사용한다.
- •복제본 간 캐시 적중률 최대 100%, TTFT 최대 2.7배 개선을 달성했다.
- •1,000토큰 이상 프롬프트에서 효과가 커지며 2,500토큰에서 개선폭이 최대(2.7배)에 이른다.
- •prefix-aware/kv-aware 라우팅 전략으로 요청을 캐시 보유 복제본에 우선 배정한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
본문 미리보기
Running large language model inference at scale forces a KV cache trade-off: oversized GPU instances or slow time-to-first-token. This post builds a tiered KV cache on Amazon SageMaker HyperPod that extends the cache into a shared, distributed NVMe pool with Curvine, so replicas reuse cache at near-local-disk speeds on cost-efficient instances.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:55AI 초안

