MERIT는 대화 기록 회상만 측정해온 기존 장기 기억 벤치마크와 달리, 기억된 사실이 실제로 도구를 사용하는 에이전트의 행동을 바꾸는지를 비용까지 명시적으로 측정하는 벤치마크다. 세 영역의 에피소드형 도구 사용 과제와 갱신된 사실 회상까지 포함한 난이도 사다리, 통제된 기억 손상, 모든 기억 연산의 토큰·비용 계측을 제공한다. 총 23,440개 에피소드(42.57달러) 실험에서 기억은 과제 성공률을 0에서 0.55~1.00까지 끌어올렸지만, 갱신된 사실에 대해서는 임베딩 검색 성능이 0.30~0.95로 예측 불가능하게 무너졌고 에이전트가 올바르게 검색한 값을 실제로 사용하는 비율은 55%에 그쳤다. 반면 구조화된 사실 저장소 같은 갱신형 저장 방식은 0.70~1.00을 유지했으며, 메모리 구현을 바꾸는 것만으로 과제 성공률이 최대 60점 차이 났고 전체 재생은 어떤 경우에도 경제적이지 않았다.
- •대화 회상이 아닌 '기억이 실제 행동을 바꾸는가'를 비용까지 계측하는 MERIT 벤치마크 제안
- •23,440개 에피소드(42.57달러) 실험에서 기억 도입 시 과제 성공률이 0→0.55~1.00로 상승
- •갱신된 사실에서 임베딩 검색은 불안정(0.30~0.95)하고 올바른 값 활용률은 55%에 불과
- •구조화된 사실 저장소 등 갱신형 저장 방식이 가장 안정적(0.70~1.00)이며 전체 재생은 비경제적
- •메모리 구현 선택만으로 과제 성공률이 최대 60점 차이 발생
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents
- 1.도구사용 에이전트의 장기메모리 실질 효용을 비용까지 고려해 측정하는 벤치마크 'MERIT' 제안
- 2.3개 도메인 에피소드 과업, 23,440건 채점, 총 42.57달러 비용으로 GPT-4.1·Claude Haiku 4.5 등 평가
- 3.메모리 적용시 과업 성공률이 0.00에서 0.55~1.00으로 상승하나, 갱신된 사실 검색은 0.30~0.95로 불안정
- 4.정확히 검색된 값을 실제 행동에 반영하는 비율은 55%에 불과, 전체 재생은 항상 비경제적(달러당 한계효용 2.7~3.9배 차)
왜 중요한가?
메모리를 갖춘 에이전트가 정답을 검색하고도 절반 가까이 그대로 반영하지 못한다는 점을 비용까지 통제된 벤치마크로 드러내, 실무 배포시 메모리 구현 선택이 성능을 최대 60%p까지 좌우함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2609.05441v1 Announce Type: new Abstract: Long-term memory for LLM agents is evaluated today by conversational recall benchmarks (LoCoMo, LongMemEval), which measure question answering over dialogue history, not whether remembered facts change what a tool-using agent does. We present MERIT (Memory Evaluation for Realistic Instrumented Tasks), a benchmark and harness that measures the marginal utility of memory for task-executing agents under explicit cost accounting. MERIT provides episod
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

