이 논문은 트랜스포머 기반 LLM의 프리필 지연 문제를 해결하기 위해 콘텐츠 위치에 상관없이 KV 캐시를 재사용할 수 있는 KVBoost 시스템을 제안한다. 위치 정보(prefix hash)와 콘텐츠 정보(content hash)를 분리하는 이중 해시 키 기법으로 임의 위치의 공유 콘텐츠도 캐시 재사용이 가능하도록 했고, 경계 영역 재인코딩(SelectiveRecompute)과 고편차 토큰만 재계산하는 방식(CacheBlendRecompute)으로 어텐션 경계 오류를 보정한다. Qwen2.5-3B 모델로 1000개 버그 위치 파악 샘플에서 평가한 결과, 첫 토큰 생성 시간이 639.1ms에서 142.4ms로 4.49배 단축됐고 정확도 손실 없이(99.2% vs 99.1%) 기존 프리픽스 캐싱보다 16% 더 우수한 성능을 보였다. int8/int4 비대칭 양자화와 적응형 청크 분할까지 결합해 메모리 제약 하에서도 실용적인 추론 가속을 제공한다.
- •KVBoost, 위치·콘텐츠 해시 분리로 임의 위치 콘텐츠도 KV 캐시 재사용 가능
- •Qwen2.5-3B 실험서 첫토큰생성시간 639.1ms→142.4ms로 4.49배 단축
- •정확도 손실 없이(99.2% vs 99.1%) 기존 프리픽스 캐싱 대비 16% 성능 우위
- •int8/int4 양자화·적응형 청크 분할 결합해 메모리 제약 하 실용적 가속 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference
- 1.콘텐츠 위치와 무관하게 청크 단위로 KV캐시를 재사용하는 KVBoost 시스템 제안
- 2.위치 정체성과 콘텐츠 정체성을 분리하는 이중 해시 키 방식으로 정확·근사 매칭 모두 지원
- 3.경계영역 재계산·고편차 토큰 재계산 두 전략으로 어텐션 경계 오류 해결
- 4.Qwen2.5-3B 1000개 샘플서 첫토큰생성시간 4.49배 단축(639.1ms→142.4ms), 정확도 손실 없음(99.2%)
왜 중요한가?
기존 프리픽스 캐싱이 프롬프트 앞부분 일치 시에만 작동했던 한계를 넘어, 콘텐츠 위치와 무관하게 재사용 가능하게 하면서도 정확도 저하 없이 추론 지연을 대폭 줄여 실제 서비스에 바로 적용 가능한 최적화를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.21362v1 Announce Type: new Abstract: Transformer-based large language models (LLMs) incur high prefill latency because key-value (KV) tensors must be recomputed for each request. Existing prefix-caching systems reduce this cost but require prompts to share a leading contiguous prefix, limiting effectiveness when shared content appears at arbitrary positions. We present KVBoost, a chunk-level KV cache reuse system for HuggingFace-compatible decoder models that enables reuse regardless
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
