LLM 서빙은 위치 독립 캐싱(PIC)으로 점점 가속화되고 있지만, 기존 PIC 방법은 토큰 인덱스 KV 캐시를 전제로 한 완전 어텐션 모델용으로 설계돼 있다. 대부분의 어텐션 레이어를 고정 크기 상태만 노출하는 선형 순환으로 대체하는 하이브리드 LLM에서는 이런 전제가 무너진다. LinearKV는 훈련이 필요 없는 하이브리드 PIC 프레임워크로, 선형 레이어는 일치하는 K개의 로컬 상태를 하나의 초기 상태로 매핑하고 완전 어텐션 레이어는 기존처럼 KV를 이어붙이는 '분리형 초기화'를 핵심 아이디어로 삼는다. 실험 결과 단일 캐시된 상태만으로도 선형 레이어 초기화에 충분했으며, 모든 K개 상태를 정확히 합성하는 대안은 불필요할 뿐 아니라 일부 아키텍처(Mamba-2)에서는 오히려 성능을 46.6%까지 떨어뜨렸다. LinearKV는 EPIC 등 기존 선택 기법을 그대로 재사용하면서 최대 92%의 전체 품질을 회복하고, 첫 토큰 생성 시간을 완전 프리필 대비 0.46배로 단축시켰다.
- •'분리형 초기화'로 선형 레이어는 단일 상태, 완전 어텐션 레이어는 기존 KV 결합 방식을 유지하는 LinearKV 제안
- •단일 캐시된 상태만으로 충분, 모든 K개 상태를 정확히 합성하는 방식은 불필요하거나 오히려 해로움(Mamba-2에서 46.6%로 하락)
- •GDN 모델에서는 두 방식이 동등, 최대 92%의 전체 품질 회복
- •첫 토큰 생성 시간을 완전 프리필 대비 0.46배로 단축, 정확 합성 대비 5~17% 오버헤드 절감
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs
본문 미리보기
arXiv:2608.11231v1 Announce Type: new Abstract: LLM serving is increasingly accelerated by position-independent caching (PIC). Existing PIC methods, however, are built for full-attention models, where a token-indexed KV cache underlies its core operations: matching reusable token chunks, concatenating their KV entries, and selectively recomputing a few tokens to restore cross-chunk context. Hybrid LLMs break these primitives---they replace most attention layers with linear recurrences that expo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

