이 논문은 LLM 에이전트의 장기 메모리가 신뢰할 수 없는 외부 관찰을 사용자 이력이나 워크플로 지지 근거로 둔갑시키는 "메모리 출처 세탁(memory provenance laundering)" 위협을 식별한다. 메모리 통합 과정에서 낮은 신뢰도의 출처 정보가 손실되면서도 행동 유발 요소는 그대로 남아, 기존 프롬프트 필터나 콘텐츠 정화 도구, 툴 가드로는 이러한 권한 증폭을 막지 못한다는 점을 규명했다. 이를 막기 위해 플랫폼이 유지하는 출처 정보를 보존하고 행동 위험도를 관련 메모리의 권한 수준과 매칭시켜 도구 호출을 승인하는 경량 미들웨어 PPMF(Provenance-Preserving Memory Firewall)를 제안했다. 평가 결과 취약한 통합 메모리에서는 공격 성공률이 최대 100%에 달했지만, 출처·확인·위험 라벨이 온전할 경우 PPMF는 승인되지 않은 고위험 행동을 전혀 통과시키지 않으면서도 정상적인 저위험 메모리 활용은 그대로 허용했다.
- •LLM 에이전트 메모리 통합 시 외부 관찰이 신뢰 출처처럼 둔갑하는 "메모리 출처 세탁" 취약점 식별
- •취약한 통합 메모리에서 공격 성공률(ASR)이 최대 100%에 달함을 실증
- •출처 보존형 메모리 방화벽 PPMF를 제안해 행동 위험도와 메모리 권한을 매칭해 승인
- •PPMF 적용 시 무단 고위험 행동은 전혀 통과하지 못하면서 정상 저위험 활용은 유지
- •기존 프롬프트 필터·콘텐츠 정화·툴 가드가 이 위협을 막지 못함을 지적, EMNLP2026 제출
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory
본문 미리보기
arXiv:2607.29167v1 Announce Type: new Abstract: Long-term memory lets large language model(LLM) agents reuse prior preferences and work flows, but it also turns untrusted observations into persistent action context. We identify memory provenance laundering: during LLM-based memory consolidation, an external observation may be rewritten as apparent user history or workflow support, preserving an action trigger while erasing the low-trust source that should limit its authority. Existing prompt fi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



