이 논문은 LLM 에이전트의 런타임 보안 방어를 수작업 설계에서 자율 진화 과정으로 전환하는 프레임워크 HARD(하네스 기반 자율 런타임 방어 진화)를 제안한다. 먼저 하네스 수준에서 런타임 방어를 정식화해 기존의 개입 메커니즘들을 통일된 관점으로 정리했다. 이를 바탕으로 HARD는 적절한 개입 전략을 자동으로 식별하고, 관찰된 실패 흔적을 바탕으로 방어 산출물을 반복적으로 개선한다. 광범위한 실험 결과 HARD는 정상 작업 성능을 유지하면서도 기존 수작업 방어보다 보안 성능을 향상시켰으며, 이는 배포된 LLM 에이전트 보호를 위한 새로운 패러다임으로서 자율 방어 진화의 가능성을 보여준다.
- •LLM 에이전트 런타임 방어를 수작업 대신 자율 진화 과정으로 전환하는 HARD 프레임워크 제안
- •하니스 수준에서 런타임 방어를 정식화해 기존 개입 메컬니즘을 통일된 관점으로 정리
- •관찰된 실패 흔적을 바탕으로 개입 전략을 자동 식별·반복 개선
- •실험 결과 정상 작업 성능 유지하면서 기존 수작업 방어보다 보안 성능 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents
- 1.LLM 에이전트 런타임 방어를 하네스 관점서 정식화, 자율진화형 방어 프레임워크 HARD 제안
- 2.기존 방어는 수작업 설계 의존, HARD는 실패흔적 기반으로 개입전략 자동식별·방어산출물 반복개선
- 3.실험서 기존 수작업 방어 대비 보안성능 향상시키면서도 정상작업 효용은 유지함을 입증
왜 중요한가?
LLM 에이전트의 운영 역량이 커질수록 공격 표면도 넓어지는데, 방어 개발을 수작업 엔지니어링에서 자율진화 과정으로 전환해 배포된 에이전트가 스스로 방어 약점을 찾아 지속 보완할 수 있는 새로운 보안 패러다임을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.12977v1 Announce Type: new Abstract: The expanding operational capabilities of large language model (LLM) agents introduce sophisticated security threats. Runtime defenses have emerged as an effective approach to mitigating these risks by integrating security mechanisms into the agent execution loop. However, existing runtime defenses rely heavily on manually designed interventions and lack a principled framework for their construction and maintenance. In this work, we first develop
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

