긴 출력 추론이 많아지면서 키-값(KV) 캐시가 LLM 서빙의 핵심 메모리 병목이 되고 있다. 기존 KV 압축 기법은 요청별로 미리 정한 고정 용량 안에서 어떤 KV 상태를 유지할지만 조정할 뿐, 디코딩 내내 총 용량은 그대로 둔다. 연구진은 KV 용량을 런타임 자원으로 취급하는 온디맨드 예산 프레임워크 'GrowPage'를 제안한다. 최근·장기 어텐션 행태를 포착하는 경량 이중 시간축 쿼리 요약을 유지하고, 상대적 어텐션 작업집합으로 수요 변화를 추정해 용량 경계마다 현재 할당 내에서 압축하거나 필요시 추가 물리 페이지를 확보한다. 페이지드어텐션(PagedAttention)의 페이지 단위 메모리 추상화와 통합돼 연속 배칭과 프리픽스 캐싱을 유지하며, 여러 모델의 추론 벤치마크에서 기존 기법 대비 우수한 성능-처리량 균형을 달성했다.
- •긴 출력 추론에서 KV 캐시가 LLM 서빙의 핵심 메모리 병목으로 부상
- •기존 기법은 요청별 고정 용량 내에서만 조정, 총 용량은 디코딩 내내 고정
- •KV 용량을 런타임 자원으로 다루는 온디맨드 예산 프레임워크 GrowPage 제안
- •이중 시간축 쿼리 요약으로 수요 변화를 추정해 압축 또는 추가 페이지 확보 결정
- •페이지드어텐션과 통합돼 연속 배칭·프리픽스 캐싱 유지하며 성능-처리량 균형 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
- 1.GrowPage는 KV캐시 용량을 고정하지 않고 런타임에 동적으로 조절하는 온디맨드 KV 버짰팅 프레임워크
- 2.이중 시간축 쿼리 요약으로 단기·장기 어텐션 패턴을 포착해 수요 변화를 추정
- 3.용량 경계마다 압축하거나 PagedAttention의 물리 페이지를 추가 확보하는 방식으로 대응
- 4.연속 배칭과 프리픽스 캐싱을 유지하면서 기존 방식 대비 우수한 성능-처리량 트레이드오프 달성
왜 중요한가?
추론 워크로드마다 KV 캐시 수요가 크게 달라지는데도 기존 방식이 고정 예산에 의존하던 한계를 극복해, 장문 추론을 서빙하는 LLM 인프라의 비용 효율을 높일 수 있는 실용적 개선이다.
언급 프로젝트
본문 미리보기
arXiv:2609.03494v1 Announce Type: new Abstract: Long-output reasoning has made the key--value (KV) cache a critical memory bottleneck for efficient LLM serving. Existing KV compression methods usually rely on a predefined per-request budget and adjust only which KV states are retained, leaving the total capacity fixed throughout decoding. However, reasoning workloads exhibit substantial demand variation: different requests require different KV capacities, and the attention demand of an individu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
