Akashic은 멀티턴 상호작용과 세션 간 워크플로우로 컨텍스트가 계속 누적되는 LLM 에이전트를 위한 저오버헤드 추론 서비스 시스템이다. 매 요청마다 전체 히스토리를 재생하면 프리필 비용 증가, 컨텍스트 한도 초과, 관련 근거 매몰 문제가 생긴다. 핵심 기술인 MemAttention은 컨텍스트를 한정 크기 청크로 조직하고 청크 간 의미 관계를 모델링해, 전체 히스토리를 반복 재작성하지 않고도 청크 간 근거를 보존한다. 함께 조회될 가능성이 높은 청크를 인접 배치하는 하드웨어-소프트웨어 공동 설계 메모리 배치로 I/O 오버헤드도 줄였다. 4개 워크로드와 3개 모델 크기에서 기존 강력한 메모리 베이스라인 대비 정확도 최대 10.2점, 처리량 최대 1.21배, 지속 가능 요청률 최대 1.88배 개선을 달성했다.
- •컸텍스트를 한정 청크로 나누고 청크 간 의미 관계를 모델링하는 MemAttention 제안
- •전체 히스토리 재작성 없이 청크 간 근거 보존
- •공동 조회 가능성 높은 청크를 인접 배치하는 HW-SW 공동 설계로 I/O 오버헤드 감소
- •4개 워크로드·3개 모델 크기에서 정확도 최대 +10.2점, 처리량 최대 1.21배
- •지속 가능 요청률 최대 1.88배 향상으로 서빙 효율과 품질 동시 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Akashic: A Low-Overhead LLM Inference Service with MemAttention
- 1.에이전트용 저비용 LLM 추론 메모리 시스템 Akashic 제안, MemAttention이 핵심
- 2.컨텍스트를 제한된 청크로 나누고 청크 간 의미 관계를 모델링해 전체 재작성 회피
- 3.함께 검색될 청크를 인접 배치하는 하드웨어-소프트웨어 공동 설계로 I/O 오버헤드 감소
- 4.4개 워크로드에서 정확도 최대 10.2점, 처리량 1.21배, 지속 요청률 1.88배 향상
왜 중요한가?
멀티턴·크로스세션 에이전트의 컨텍스트 누적이 프리필 비용과 품질 저하를 동시에 유발하는 문제를 메모리 구조 차원에서 풀어, 장기 실행 에이전트 서빙의 실질적 병목을 완화한다.
언급 프로젝트
본문 미리보기
arXiv:2607.05708v1 Announce Type: new Abstract: Recent LLM-based agent systems continuously accumulate context across multi-turn interactions, tool invocations, and cross-session workflows. Replaying the full history for every request quickly becomes impractical: long contexts increase prefill cost, may exceed context limits, and often bury task-relevant evidence in irrelevant content, degrading both serving efficiency and output quality. We propose Akashic, a low-overhead memory system built a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

