KV 캐시 양자화에서 키(key)와 값(value)에 서로 다른 축을 적용해야 한다는 사실이, 동일한 2비트 정밀도에서도 벤치마크 점수를 2.88에서 63.53까지(전체 정밀도는 66.37) 좌우한다는 분석이다. 라마-2-13B 실험에서 키는 채널 단위로, 값은 토큰 단위로 양자화해야 최적 성능이 나오며, 두 축을 반대로 적용하면 어텐션 점수 오차가 5배 이상, 값의 경우 14배 이상 커진다. 원인은 어텐션이 희소하다는 점(84.3%)으로, 토큰 단위 양자화는 중요하지 않은 토큰의 오차를 자연스럽게 무시하게 해준다. 저장 시점의 재구성 오차만으로 검증하면 오히려 모델을 망가뜨리는 설정을 고를 수 있어, 실제 소비되는 연산(어텐션 출력)을 기준으로 검증해야 한다는 것이 핵심 교훈이다. 올바른 축과 최근 토큰용 고정밀 잔차 버퍼를 함께 쓰면 KIVI 기준 최대 메모리 사용량을 2.6배 줄이고 처리량을 최대 3.47배 높일 수 있다.
- •라마-2-13B에서 동일 2비트 정밀도라도 양자화 축 선택에 따라 CoQA 점수가 2.88~63.53(전체정밀도 66.37)까지 갈린다.
- •키는 채널 단위, 값은 토큰 단위로 양자화해야 하며, 두 축을 뒤바꾸면 모델 성능이 붕괴한다.
- •값 캐시는 저장 시점 재구성 오차와 실제 어텐션 출력 오차의 순위가 정반대로 뒤집힌다(3.73 vs 4.57 대 3.55 vs 49.89).
- •84.3%에 달하는 어텐션 희소성 덕분에 토큰 단위 양자화는 중요하지 않은 토큰의 오차를 자연스럽게 제거한다.
- •KIVI 방식 적용 시 최대 메모리 사용량 2.6배 감소, 처리량 최대 3.47배 향상 효과가 확인됐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Your KV Cache Doesn’t Have a Bit Problem. It Has a Geometry Problem.

본문 미리보기
At identical 2-bit precision, one decision about which axis you quantize along swings a benchmark score from 2.88 to 63.53. Keys and values need opposite treatment — and the reason is in the attention equation, not the hardware. Take Llama-2-13B. Group its key-value cache by a quantization group size of 32 into two bits, while leaving everything else in place — same model, same bit budget, same group sizes, same benchmarks. Depending on one single element of an implementation decision, CoQA…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:47AI 초안

