이 논문은 LLM 에이전트의 장기 기억을 오염시켜 신뢰할 수 없는 외부 콘텐츠가 에이전트의 향후 결정에 지속적인 영향을 미치게 하는 '간접 기억 오염' 공격을 다룬다. 기존 공격은 기억 쓰기·검색·활용이라는 다단계 파이프라인의 각 단계를 개별 최적화해 단계 간 결합 효과를 놓쳤는데, 저자들은 이를 엔드투엔드 최적화 문제로 재정의한 공격 기법 'PipePoison'을 제안한다. PipePoison은 로컬 섀도 시스템에서 세부 단계별 피드백을 수집하고, 체인 구조 손실 함수로 전체 성공을 가로막는 병목 단계를 찾아 최적화하며, 안정성 보정 가중치로 전이성을 높인다. 3개의 에이전트 프레임워크와 4개의 기억 메커니즘에 걸친 실험에서 공격 활용률을 19.1%포인트 개선했고, 전혀 보지 못한 피해자 설정에서도 가장 강력한 기준선보다 16%포인트 앞섰으며 8가지 대표적 방어 기법 하에서도 효과를 유지했다.
- •LLM 에이전트 장기 기억을 오염시키는 간접 메모리 포이징을 엔드투엔드 최적화 문제로 재정의
- •PipePoison, 로컬 새도 시스템 피드백과 체인 구조 손실로 병목 단계를 찾아 최적화
- •3개 프레임워크·4개 메모리 메커니즘에서 공격 활용률 19.1%포인트 개선
- •미확인 피해자 설정에서도 기존 최강 기준선 대비 16%포인트 우위, 8개 방어 기법 하에서도 효과 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents
- 1.LLM 에이전트 장기기억 오염 공격을 기록-검색-활용 전 단계 통합 최적화 문제로 재정의한 PipePoison 제안
- 2.샨도 시스템에서 단계별 세밀 피드백을 수집해 병목 단계를 식별하는 체인구조 손실함수 적용
- 3.3개 에이전트 프레임워크·4개 메모리 메커니즘에서 공격활용률 19.1%p 향상
- 4.미지의 피해자 구성에서도 기존 최강 베이스라인 대비 16%p 우위, 8종 방어기법 하에서도 효과 유지
왜 중요한가?
단계별로 따로 최적화하던 기존 공격과 달리 파이프라인 전체를 하나로 최적화함으로써, 신뢰할 수 없는 외부 콘텐츠가 에이전트의 장기 판단에 지속적으로 영향을 주는 취약점의 실질적 위협 수준을 드러낸다.
언급 프로젝트
본문 미리보기
arXiv:2609.00523v1 Announce Type: new Abstract: Long-term memory can turn untrusted external content into persistent influence over an LLM agent's future decisions, creating the threat of indirect memory poisoning. A successful attack must survive a multi-stage pipeline comprising memory writing, retrieval, and utilization. Existing attacks largely rely on intra-stage optimization, optimizing individual stages in isolation while overlooking inter-stage coupling. Specifically, these stages impos
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
