KV 캐시를 25%만 남기고도 생성 품질을 거의 유지하는 학습 불필요(training-free) 압축 프레임워크 SelKV가 제안됐다. 값 벡터 유사도 기반 소프트 코사인 게이트로 토큰별 병합·폐기를 선별해 의미 훼손을 막고, 프리필 어텐션 통계로 디코딩 시 로짓을 보정해 병합 토큰이 과소 어텐션을 받는 'attention sag' 문제를 해결한다. LongBench 16개 영어 데이터셋에서 원샷 압축 베이스라인을 앞섰고, GQA 모델에서 특히 강건하며, 복잡한 다중 문서 QA에서는 전체 캐시 베이스라인보다 높은 성능에 10만 토큰 기준 3.3배 디코딩 속도 향상을 달성했다. 긴 컨텍스트 LLM 서빙의 메모리 병목을 재학습 없이 완화할 수 있는 실용적 방법이다.
- •값 벡터 코사인 유사도 기반 소프트 게이트로 토큰별 병합·폐기를 선별하는 학습 불필요 KV 캐시 압축
- •프리필 어텐션 통계 기반 로짓 보정으로 병합 토큰의 softmax 불균형(attention sag) 교정
- •KV 캐시 25%만 유지하고도 LongBench 16개 데이터셋에서 원샷 압축 베이스라인 대비 우수
- •GQA 모델에서 거의 무손실 생성 품질 유지, 다중 문서 QA에선 전체 캐시보다 높은 성능
- •100k 토큰 기준 3.3배 디코딩 속도 향상
SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation
- 1.KV 캐시 25%만 유지하고도 손실 최소화하는 학습 불필요(training-free) 압축 기법 SelKV 제안
- 2.코사인 게이트로 유사 토큰만 선택적 병합, 병합으로 생긴 softmax 불균형은 로짓 보정으로 해소
- 3.LongBench 16개 데이터셋에서 원샷 압축 베이스라인 대비 우수, GQA 모델에서 거의 무손실
- 4.100k 토큰에서 디코딩 3.3배 가속, 다중 문서 QA에선 풀캐시보다도 높은 성능
왜 중요한가?
긴 컨텍스트 LLM 서빙의 최대 병목인 KV 캐시 메모리를 재학습 없이 1/4로 줄이면서 속도까지 얻는 기법으로, 장문 처리 비용 절감이 필요한 추론 인프라에 즉시 적용 가능한 개선이다.
본문 미리보기
arXiv:2607.16213v1 Announce Type: new Abstract: Large Language Models (LLMs) generate text autoregressively, relying on a key-value (KV) cache whose memory footprint grows linearly with context length, creating a major bottleneck. Recent compression methods mitigate this cost via token merging; however, these approaches often rely on indiscriminate aggregation, which degrades representations and introduces attention sag, a mismatch where merged tokens receive the same softmax mass as individual
전체 내용이 궁금하다면?
원문을 직접 읽어보세요