KV 캐시를 25%만 남기고도 생성 품질을 거의 유지하는 학습 불필요(training-free) 압축 프레임워크 SelKV가 제안됐다. 값 벡터 유사도 기반 소프트 코사인 게이트로 토큰별 병합·폐기를 선별해 의미 훼손을 막고, 프리필 어텐션 통계로 디코딩 시 로짓을 보정해 병합 토큰이 과소 어텐션을 받는 'attention sag' 문제를 해결한다. LongBench 16개 영어 데이터셋에서 원샷 압축 베이스라인을 앞섰고, GQA 모델에서 특히 강건하며, 복잡한 다중 문서 QA에서는 전체 캐시 베이스라인보다 높은 성능에 10만 토큰 기준 3.3배 디코딩 속도 향상을 달성했다. 긴 컨텍스트 LLM 서빙의 메모리 병목을 재학습 없이 완화할 수 있는 실용적 방법이다.
- •값 벡터 코사인 유사도 기반 소프트 게이트로 토큰별 병합·폐기를 선별하는 학습 불필요 KV 캐시 압축
- •프리필 어텐션 통계 기반 로짓 보정으로 병합 토큰의 softmax 불균형(attention sag) 교정
- •KV 캐시 25%만 유지하고도 LongBench 16개 데이터셋에서 원샷 압축 베이스라인 대비 우수
- •GQA 모델에서 거의 무손실 생성 품질 유지, 다중 문서 QA에선 전체 캐시보다 높은 성능
- •100k 토큰 기준 3.3배 디코딩 속도 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation
- 1.KV 캐시 25%만 유지하고도 손실 최소화하는 학습 불필요(training-free) 압축 기법 SelKV 제안
- 2.코사인 게이트로 유사 토큰만 선택적 병합, 병합으로 생긴 softmax 불균형은 로짓 보정으로 해소
- 3.LongBench 16개 데이터셋에서 원샷 압축 베이스라인 대비 우수, GQA 모델에서 거의 무손실
- 4.100k 토큰에서 디코딩 3.3배 가속, 다중 문서 QA에선 풀캐시보다도 높은 성능
왜 중요한가?
긴 컨텍스트 LLM 서빙의 최대 병목인 KV 캐시 메모리를 재학습 없이 1/4로 줄이면서 속도까지 얻는 기법으로, 장문 처리 비용 절감이 필요한 추론 인프라에 즉시 적용 가능한 개선이다.
LLM의 핵심 병목 중 하나인 KV 캐시의 메모리 효율성을 개선하는 SelKV 기술은 국내 대규모 언어 모델 개발 및 서비스 운영에 중대한 영향을 미칠 것입니다. 컨텍스트 길이가 길어질수록 막대한 메모리 사용량 문제가 국내 기업의 LLM 도입과 확산을 가로막는 상황에서, 이러한 효율화 기술은 모델의 성능은 유지하면서 비용 부담을 줄이는 실질적인 해결책을 제시합니다. 이는 국내 AI 기업들이 더 효율적으로 LLM을 활용하고 경쟁력을 확보하는 데 기여할 수 있습니다.
본문 미리보기
arXiv:2607.16213v1 Announce Type: new Abstract: Large Language Models (LLMs) generate text autoregressively, relying on a key-value (KV) cache whose memory footprint grows linearly with context length, creating a major bottleneck. Recent compression methods mitigate this cost via token merging; however, these approaches often rely on indiscriminate aggregation, which degrades representations and introduces attention sag, a mismatch where merged tokens receive the same softmax mass as individual
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

