이 논문은 장기 LLM 에이전트에서 순차적 동기식 요약 압축의 병목(수십 초 지연, 낮은 제어성, 실행 간 불일치)을 해결하는 병렬 압축(parallel compaction) 방식을 제안한다. 8B~120B 파라미터, 밀집·MoE, 추론·비추론 모델 등 4개 백본과 HotpotQA·LoCoMo 벤치마크에서 평가한 결과, 동일한 압축 디코딩 볼륨에서 순차 기준선 대비 종단간 벽시계 시간을 단축하고 압축 처리량을 개선했다. 운영자에게 요약 볼륨에 대한 세밀하고 예측 가능한 제어와 블록별 타겟 프롬프트 엔지니어링을 가능하게 한다. 컨텍스트 압축 품질의 예측 가능성을 높여 에이전트 지식 보존의 일관성을 개선하는 실용적 접근을 제시한다.
- •병렬 압축: 콘텍스트 압축을 블록 단위 병렬 처리로 순차 동기식 요약의 수십 초 지연 해소
- •4개 백본(8B~120B, 밀집·MoE, 추론·비추론) × HotpotQA·LoCoMo에서 검증
- •동일 압축 볼륨에서 종단간 벽시계 시간 단축, 압축 처리량 개선
- •운영자에게 요약 볼륨 세밀·예측 가능한 제어 + 블록별 타겟 프롬프트 엔지니어링 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Parallel Context Compaction for Long-Horizon LLM Agent Serving
- 1.LLM 에이전트 긴 대화 기록이 컨텍스트 창을 초과할 때 기존 순차 요약은 수십 초 블로킹과 출력 토큰 불안정 문제 발생
- 2.병렬 컴팩션은 요약 블록을 병렬 처리하여 요약 볼륨에 대한 세밀하고 예측 가능한 제어와 타겟 프롬프트 엔지니어링 가능
- 3.8B~120B 파라미터 4개 백본, HotpotQA·LoCoMo 벤치마크에서 동일 디코딩 볼륨 대비 엔드-투-엔드 레이턴시 감소 확인
왜 중요한가?
장기 에이전트 서비스에서 컨텍스트 압축은 필수 과제인데, 병렬 컴팩션은 블로킹 없이 연산자가 요약 품질을 예측·제어 가능하게 하여 프로덕션 에이전트 서빙의 실용성을 크게 높인다.
본문 미리보기
arXiv:2605.23296v1 Announce Type: new Abstract: Long-horizon LLM agents accumulate growing conversation histories that eventually exceed the model's context window. Context compaction via LLM-based summarization keeps the conversation bounded, but summarization is inherently lossy and the blocking call stalls agent inference for tens of seconds. Moreover, the operator has no fine-grained control over summary volume since prompt instructions are largely ignored, and as context grows, both the am
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

