이 논문은 지속형 메모리를 갖춘 개인화 에이전트에서 오래된 저장 사실이 경고 없이 현재의 권위 있는 증거를 무시하게 만드는 '메모리 신뢰 격차'가 모델 역량 변화에 따라 언제 발생하는지를 다룬다. Qwen3 0.6B~8B 동일 계열 모델 시리즈를, 저장된 사실 없이는 풀 수 없는 '이익' 스위트와 항상 정확한 값을 제공하는 권위 있는 도구가 있는 '안전' 스위트로 평가한 결과, 이익 스위트에서는 모든 규모에서 92~100%의 확률로 오래된 값을 답했다. 안전 스위트에서는 오래된 메모를 최신처럼 보이게 만든 함정 조건 하에서 대형 모델일수록 더 크게 무너지는 역량 게이팅 현상이 나타났다. 4중 요인 분석 결과 과신을 유발하는 특징은 특징과 모델 규모 모두에 좌우되며, 라벨 제거는 모든 규모에서 과신을 증폭시키고 최신성 위장 특징은 대형 모델을 더 크게 속였다. 완화책도 역량 의존적이어서, 메타데이터 노출은 역량 있는 모델의 정확도를 개선했지만 소형 체크포인트는 충돌을 사전 해결해야만 정확도가 회복됐다.
- •지속형 메모리의 오래된 사실이 권위 있는 증거를 무시하게 만드는 '메모리 신뢰 격차' 현상을 정의했다.
- •이익 스위트에서 모든 모델 규모가 92~100% 확률로 오래된 값을 답하는 과신 양상을 보였다.
- •안전 스위트에서는 위장된 함정에 대형 모델이 더 크게 무너지는 역량 게이팅이 나타났다.
- •라벨 제거와 최신성 위장 특징이 특히 강한 과신 증폭 효과를 냈다.
- •완화책도 역량 의존적이라 소형 모델은 충돌을 사전 해결해야만 정확도가 회복되었다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents
- 1.지속 메모리 에이전트가 오래된 저장 사실을 최신 권위 정보보다 과신하는 'Memory Trust Gap' 규명
- 2.Qwen3 0.6/1.7/4/8B로 Benefit·Safety 평가, Benefit에선 모든 규모서 0.92~1.00 확률로 오래된 값 응답
- 3.Safety에선 오래된 메모리가 최신처럼 보이면 대형 모델일수록 더 크게 붕괴
- 4.메타데이터 노출은 대형 모델에만 효과, 소형 모델은 충돌 사전 해결해야 정확도 회복
왜 중요한가?
개인화 에이전트에 메모리 기능을 추가할수록 오래된 정보를 과신해 안전사고로 이어질 위험이 있음을 실증해, 메모리 시스템 설계에 검증 로직이 반드시 필요함을 보여준다.
본문 미리보기
arXiv:2609.01852v1 Announce Type: new Abstract: Persistent memory supports personalized agents, but a stale stored fact can override current authoritative evidence without warning. We study when this harm begins as model capability changes. We evaluate a frozen, closed-set, action-scored benchmark with 2 suites that represent 2 different meanings of "no memory" (a Benefit suite, unsolvable without the stored fact, and a Safety suite, in which an authoritative tool always holds the correct value
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
