AgentKVShift는 메모리 증강 LLM 에이전트의 KV 캐시 재사용 비용을 줄이는 학습 불필요 기법이다. 에이전트 메모리는 요약·키워드·태그 같은 메타데이터로 구조화돼 있어 검색할 때마다 전체 재인코딩이 일어나 prefill 지연을 지배하는데, 저자들은 메모리 단위별 KV 재사용 잔차가 '공유 오프셋 + 작은 토큰별 변동'으로 분해된다는 점을 발견했다. 소규모 프로브 집합으로 이 오프셋을 추정해 재계산하지 않는 토큰까지 한 번의 가중 보정으로 교정한다. 3B~32B 오픈소스 LLM 4종과 장기 대화·에이전트 응용 벤치마크 2종에서 캐시의 10~30%만 갱신하고도 전체 재계산에 근접한 성능을 냈고, 기존 기법이 45~55% 갱신에서야 도달하던 수준을 최대 5배 적은 재계산으로 달성했다. A100 단일 GPU 기준 prefill 속도는 2~3.5배 빨라졌다.
- •기존 KV 재사용 기법은 RAG식 원문 패슬지용으로 설계돼 구조화된 에이전트 메모리에서는 성능이 떨어졌다.
- •핵심 통찰은 메모리 단위 KV 잔차가 공유 오프셋과 작은 토큰별 변동으로 분해된다는 점이다.
- •재계산하지 않는 토큰까지 보정해 갱신 예산을 청크 전체에 유용한 신호로 전환한다.
- •3B~32B 모델 4종에서 캐시 10~30%만 갱신하고도 전체 재계산에 근접한 성능을 냈다.
- •A100 단일 GPU에서 prefill 2~3.5배 가속, KV 양자화와 결합 시 2·4비트에서도 기존 대비 F1 2배 이상을 유지했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
본문 미리보기
arXiv:2607.21604v1 Announce Type: new Abstract: Memory-augmented LLM agents maintain context across hundreds of interactions through agentic memory systems that actively curate retrieved content with LLM-generated metadata such as summaries, keywords, and tags. From an inference cost standpoint, every retrieval triggers a full re-encoding of these structured memory units into Key-Value (KV) states, which dominates prefill latency. Existing training-free KV reuse methods mitigate this by selecti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요