연구진이 LLM 에이전트를 프롬프트 인젝션 공격으로부터 지키는 자기진화형 방어 시스템 AgentAntibody를 제안했다. 기존 방어는 각 작업을 독립적으로 취급해 이전 경험을 활용하지 못했지만, AgentAntibody는 생물학적 적응 면역계에서 착안해 사용자의 보안 경계에 대한 이해를 '항체' 라이브러리 형태로 축적한다. 실행 중 이 라이브러리가 사용자 경계를 위협하는 시도를 인식하고 그에 맞는 면역 반응을 발동하며, 사례를 거치며 향후 공격에 대한 면역력을 강화한다. 3개 벤치마크와 4개 기반 LLM에 걸친 광범위한 실험에서 유해 행동과 정당한 작업이 모두 작업 지시와 부합하는 모호한 상황에서도 기존 방어들보다 유해 행위 차단과 정상 작업 수행 유지를 동시에 더 잘 해냈다. 반복적인 경험 학습을 통해 프롬프트 인젝션 방어의 정확도를 높일 수 있음을 보여준다.
- •적응 면역계에서 착안해 사용자 보안 경계를 '항체' 라이브러리로 축적하는 자기진화형 방어를 제안했다
- •이전 공격 경험을 학습해 이후 유사 공격에 대한 면역력을 강화한다
- •3개 벤치마크·4개 기반 LLM에서 기존 방어보다 유해 행위 차단과 정상 작업 수행을 동시에 개선했다
- •유해·정당 행동이 모두 작업 지시와 부합하는 모호한 상황에서도 효과를 유지했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection
본문 미리보기
arXiv:2608.04053v1 Announce Type: new Abstract: Prompt injection remains a critical threat to LLM agents, yet existing defenses treat each task as a self-contained problem, independent of previous encounters. In practice, user requests are often underspecified: they describe the desired outcome without fully specifying acceptable behavior. An injection can exploit this ambiguity, causing the agent to complete the task in a way the user would reject. As the user's expectations become clearer thr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



