LLM 에이전트의 메모리 오염 방어 기법들이 실제로는 정상적인(비공격) 상황에서 어떤 비용을 치르는지 측정한 연구가 나왔다. 입력 살균, 출처 검증, LLM 기반 이상 탐지 등 3가지 쓰기 시점 방어는 정상 트래픽에서 유의미한 성능 저하가 없었던 반면, 읽기 시점 방어인 리랭커는 정확도를 4.4점 낮췄고 공격이 전혀 없는 대화에서도 항목의 33.6%를 오탐 격리했으며 한 대화에서 최대 106건까지 잘못 격리했다. 4가지 방어를 모두 결합해도 비용이 누적되지 않았고 오히려 정확도 손실 폭이 줄어, 쓰기 시점 방어가 리랭커의 손실 일부를 상쇄하는 것으로 나타났다. 방어가 LLM을 쓰는지 여부보다 파이프라인의 어느 지점을 가로채는지가 실제 비용을 좌우한다는 결론이다.
- •쓰기 시점 방어(입력 살균·출처 검증·이상 탐지) 3종은 정상 트래픽에서 측정 가능한 비용 없음
- •읽기 시점 방어인 리랭커는 정확도 4.4점 하락, 정상 대화의 33.6% 항목을 오탐 격리
- •한 대화에서 최대 106건의 정당한 메모리가 잘못 격리되는 사례 발견
- •4가지 방어를 모두 적용해도 비용이 누적되지 않고 오히려 상쇄 효과
- •방어 비용은 LLM 사용 여부가 아니라 파이프라인 개입 지점이 결정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Price of Safety: Benign-Case Utility and Token Overhead of Memory-Poisoning Defenses in LLM Agents
- 1.LLM 에이전트 메모리 포이즈닝 방어를 정상 트래픽에서 평가하는 벤치마크 설계
- 2.쓰기시점 방어 3종(입력정제·출처검증·이상탐지)은 해상 가능한 비용 없음 확인
- 3.읽기시점 리랭커는 정확도 4.4점 하락, 정상 대화 33.6% 오탐 격리(최대 106건)
- 4.4개 방어책을 모두 적용해도 비용이 누적되지 않고 오히려 손실이 줄어듦
왜 중요한가?
메모리 포이즈닝 방어는 그간 공격 차단력만으로 평가돼 정상 사용시 숨은 비용이 간과됐는데, 리랭킹이 실제로 정당한 메모리를 다수 오탐 격리한다는 수치를 제시해 도입 전 비용-편익 판단 기준을 제공한다.
본문 미리보기
arXiv:2609.22818v1 Announce Type: new Abstract: Memory-poisoning defenses for LLM agents are typically evaluated by their ability to prevent attacks. However, the traffic they process is rarely adversarial. The cost of implementing a defense is paid with each interaction, while its benefits are only seen in a small percentage of cases. We developed a measurement setup that keeps the memory backend, retrieval process, and judge consistent across different conditions, changing only the defense it
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

