LLM 기반 에이전트 추천 시스템(LLM-ARS)은 사용자와 아이템을 자율 에이전트로 만들어 '협력적 반성'으로 선호를 반복 정교화하지만, 이 과정이 새로운 취약점을 만든다. 한 에이전트에 주입된 적대적 증거가 합리화되어 메모리에 기록되고 다른 에이전트로 전파되는 '반성 세탁' 및 '협력적 반성 탈취' 현상을 저자들은 규명했다. 이를 악용한 최초의 블랙박스 타겟 프로모션 공격 VirusCascade를 제안했으며, 네 개의 실제 데이터셋과 다양한 LLM-ARS 구조 실험에서 평균 E@20 0.384로 기존 최강 베이스라인을 0.185 앞서는 성능을 달성했다. 기존의 정적 데이터 중독·적대적 섭동 공격은 이런 반복적·다중 에이전트 증폭 경로를 활용할 수 없었다는 점에서 새로운 공격 표면을 드러낸다.
- •LLM 에이전트 추천 시스템의 '협력적 반성' 메커니즘이 적대적 증거를 정당한 선호로 세탁해 다른 에이전트로 전파시키는 취약점 발견
- •이를 악용한 최초의 블랙박스 타겟 프로모션 공격 VirusCascade 제안
- •4개 실제 데이터셋, 다양한 LLM-ARS 구조에서 평균 E@20 0.384로 최강 베이스라인 대비 +0.185 달성
- •기존 정적 데이터 중독·적대적 섭동 공격은 이 반복적 다중 에이전트 증폭 경로를 활용하지 못함
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
VirusCascade: Hijacking Collaborative Reflection in LLM-Powered Recommender Agents
- 1.LLM 기반 에이전트형 추천시스템(LLM-ARS)의 '협업적 성찰' 메커니즘을 노리는 공격 VirusCascade 제안
- 2.한 에이전트에 주입한 조작 근거가 '성찰 세탁'을 거쳐 메모리에 기록되고 다른 에이전트로 전파됨을 규명
- 3.반사적 지속성과 에이전트 간 전파 가능성이라는 두 취약 속성을 통제 실험으로 입증
- 4.4개 실제 데이터셋에서 평균 E@20 0.384로 기존 최강 기준선 대비 0.185p 앞서는 성능 달성
왜 중요한가?
정적 파이프라인을 가정한 기존 추천시스템 공격과 달리 에이전트 간 메모리 전파라는 새로운 경로를 악용해, LLM 에이전트형 추천 서비스에 특화된 방어가 필요함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2609.38270v1 Announce Type: new Abstract: Advancing beyond traditional static scoring models, LLM-powered agentic recommender systems (LLM-ARS) instantiate users and items as autonomous agents, whose semantic states are dynamically refined through a recurrent process known as collaborative reflection. While this mechanism improves recommendation quality, it simultaneously introduces a systemic vulnerability: adversarial evidence injected into a single agent can be rationalised into a legi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

