LLM 에이전트의 에피소딕 메모리가 각 메모리를 독립적으로 평가하여 메모리 간 의존성 체인을 고려하지 못하는 한계를 해결하기 위해 MemQ를 제안한다. MemQ는 TD(λ) 자격 흔적을 메모리 Q-값에 적용하고, 새 메모리 생성 시 어떤 메모리가 검색됐는지를 기록하는 출처 DAG를 통해 크레딧을 역방향으로 전파한다. 6개 벤치마크(OS 상호작용·함수 호출·코드 생성·멀티모달 추론·구현적 추론·전문가 QA) 전체에서 가장 높은 성공률을 달성했으며, 다단계 작업에서 최대 5.7pp 향상을 보였다.
- •기존 에피소드 메모리는 메모리 간 의존성 체인을 고려하지 못해 다단계 작업에서 한계가 있다
- •MemQ는 TD(λ) 자격 흔적을 출처 DAG에 적용하여 구조적 근접성으로 크레딧을 역방향 전파한다
- •6개 벤치마크 전체에서 MemQ가 가장 높은 성공률을 달성했다
- •심층한 출처 체인을 하는 다단계 작업에서 최대 +5.7pp의 성능 향상을 보였다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs
- 1.MemQ: TD(λ) 자격 추적을 메모리 Q값에 적용해 출자 DAG 기반 신용 역전파 구현
- 2.DAG 깊이에 따라 (γλ)^d로 감솜하여 시간적 거리 대신 구조적 근접성으로 메모리 평가
- 3.OS 인터랙션·코드 생성 등 6개 벤치마크 전체에서 최고 성공률 달성, 다단계 작업에서 최대 +5.7pp 향상
왜 중요한가?
에피소딕 메모리를 개별 평가하던 기존 방식의 한계를 극복하고, 메모리 의존성 체인을 고려한 강화학습 기반 메모리 관리 패러다임을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.08374v1 Announce Type: new Abstract: Episodic memory allows LLM agents to accumulate and retrieve experience, but current methods treat each memory independently, i.e., evaluating retrieval quality in isolation without accounting for the dependency chains through which memories enable the creation of future memories. We introduce MemQ, which applies TD($\lambda$) eligibility traces to memory Q-values, propagating credit backward through a provenance DAG that records which memories we
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

