TrustMem은 LLM 에이전트의 장기 기억 갱신 과정에서 발생하는 정보 누락, 기존 기억 손상, 환각 콘텐츠 주입 문제를 줄이는 신뢰성 있는 기억 통합 프레임워크다. Memory Transition Verifier가 기억 갱신 전이를 포괄성(coverage), 보존성(preservation), 충실성(faithfulness) 기준으로 평가하고, 같은 기억 상태에서 후보 갱신들 간 선호 쌍을 구성해 선호 기반 강화학습으로 갱신 행동을 직접 최적화한다. MemoryAgentBench, HaluMem, Mem-alpha 검증셋에서 최고 성능을 기록했으며, HaluMem 기억 추출 F1을 12.14점 높이고 누락·손상·환각을 최강 베이스라인 대비 각각 40.1%, 79.1%, 50.0% 줄였다. 저장된 오류가 영구적 시스템 장애로 굳는 장기 기억 에이전트의 핵심 신뢰성 문제를 다룬 점이 의미 있다.
- •기억 갱신 오류(누락·손상·환각)가 영구적 시스템 상태 장애로 굳는 문제를 직접 겵냥
- •Memory Transition Verifier가 포괄성·보존성·충실성 3축으로 기억 전이를 평가
- •후보 갱신 간 선호 쌍을 구성해 선호 기반 강화학습으로 갱신 행동 최적화
- •MemoryAgentBench·HaluMem·Mem-alpha에서 SOTA, HaluMem 추출 F1 +12.14점
- •누락 40.1%, 손상 79.1%, 환각 50.0% 감소(각 오류 유형별 최강 베이스라인 대비)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory
- 1.LLM 에이전트의 장기 메모리 갱신 신뢰성을 높이는 TrustMem 프레임워크 제안
- 2.메모리 전이 검증기로 커버리지·보존·충실성 관점에서 갱신을 평가
- 3.선호쌍 구성 후 선호 기반 RL로 메모리 갱신 행동을 직접 최적화
- 4.MemoryAgentBench·HaluMem·Mem-alpha SOTA, 누락·손상·환각을 40·79·50% 감소
왜 중요한가?
기존 메모리 에이전트의 쓰기·수정·삭제가 중요한 정보를 누락하거나 기존 메모리를 손상·환각으로 오염시키면 그 오류가 지속적 시스템 상태 실패로 남는다는 문제를 정면으로 다룬다. TrustMem은 전이 단위의 누락·손상·환각을 각각 40.1%·79.1%·50.0% 줄여, 장기 기억 기반 에이전트의 신뢰성을 실질적으로 끌어올린다.
본문 미리보기
arXiv:2606.25161v1 Announce Type: new Abstract: Large language model (LLM) agents rely on long-term memory to support extended interactions and personalized assistance beyond finite context windows. Existing memory agents actively update external memory through generated write, revise, and delete operations, but these updates may omit important information, corrupt existing memory, or introduce unsupported hallucinated content. Once stored, such errors become persistent system-state failures th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

