이 논문은 하이브리드 장문맥 언어모델에서 잔여 전역 어텐션 레이어의 키-값(KV) 캐시를 압축하는 학습이 필요 없는 프레임워크 HeadWiseKV를 제안한다. 각 물리적 KV 헤드에 정적인 다단계 히스토리 윈도우를 할당해 서빙 전에 캐시 수요를 예측 가능하게 만들고, 레이어를 실행 순서대로 처리하며 하위 레이어의 정책을 반영하는 SeqCalib 알고리즘으로 할당을 최적화한다. 4개의 하이브리드 장문맥 모델에서 평가한 결과 RULER와 LoCoMo 품질을 전체 KV 캐시 수준에 근접하게 유지했으며, Qwen3.6-27B 실험에서는 112K 컨텍스트 길이에서 최대 디바이스 메모리를 8.59% 줄이고 검증된 최대 컨텍스트 길이를 114K에서 161K로 확장했다.
- •HeadWiseKV는 하이브리드 언어모델의 잔여 전역 KV 캐시를 학습 없이 압축하는 프레임워크다.
- •물리적 KV 헤드별로 정적 다단계 히스토리 윈도우를 할당해 캐시 수요를 사전에 예측 가능하게 한다.
- •SeqCalib 알고리즘이 레이어 간 상호작용을 고려해 순차적으로 압축 정책을 생성한다.
- •4개 하이브리드 모델에서 RULER·LoCoMo 품질을 전체 KV 캐시 수준으로 유지했다.
- •Qwen3.6-27B에서 112K 컨텍스트 기준 최대 메모리를 8.59% 줄이고 최대 컨텍스트를 114K→161K로 확장했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models
- 1.HeadWiseKV: 하이브리드 장문맥 LLM의 KV 캐시를 헤드별로 압축하는 학습 불필요 기법
- 2.SeqCalib 알고리즘으로 레이어별 정책을 순차 결정, 계층 간 상호작용까지 반영
- 3.Qwen3.6-27B 기준 112K 컨텍스트서 피크 메모리 8.59% 절감, 최대 컨텍스트 114K→161K 확장
- 4.RULER·LoCoMo 품질을 Full-KV 대비 거의 유지
왜 중요한가?
장문맥 추론의 최대 병목인 KV 캐시 메모리를 학습 없이 줄이면서 품질 저하를 최소화해, 동일 GPU로 더 긴 컨텍스트를 서비스할 수 있는 실질적 배포 이점을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2609.02029v1 Announce Type: new Abstract: Long-context inference retains a growing key--value (KV) cache during decoding, which consumes substantial GPU memory and can reduce generation throughput. This bottleneck remains in hybrid language models because their residual global-attention layers can dominate context-dependent cache demand. We study how to allocate this state under an aggregate KV-residency budget. We introduce HeadWiseKV, a training-free framework that compresses the residu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
