LLM 에이전트는 기억, 계획, 도구 실행 등 여러 단계로 이뤄진 워크플로를 통해 복잡한 작업을 수행하는데, 위험은 각 단계에서 발생해 다음 단계로 전파되며 탐지와 완화가 어렵다. 기존 안전 기법은 개별 단계만 보호하고 서로 통합하기 어려워 워크플로 전반에 걸친 포괄적 방어가 부족했다. 이 연구는 다양한 안전 설계를 재사용 가능한 구성요소로 표현하는 '단계별 안전 스킬' 추상화를 도입하고, 기존 안전 설계를 이 스킬로 자동 변환하는 파이프라인과 커뮤니티 기반 스킬 라이브러리를 구축했다. 이를 바탕으로 가드 에이전트가 워크플로 전반에서 단계별 안전 스킬을 오케스트레이션하는 다단계 방어 프레임워크 S³를 제안하고, 이를 평가할 다단계 위험 벤치마크(MSRB)를 구축했다. 실험 결과 S³는 안전 효과성과 유용성 보존 양쪽에서 대표적인 최신 기법들을 일관되게 능가했다.
- •기억·계획·도구 실행 등 단계별로 전파되는 에이전트 위험을 다루는 '단계별 안전 스킬' 추상화 제안
- •기존 안전 설계를 재사용 가능한 스킬로 변환하는 자동 파이프라인과 커뮤니티 라이브러리 구축
- •가드 에이전트가 단계별 스킬을 오케스트레이션하는 다단계 방어 프레임워크 S³ 제안
- •다단계 위험 벤치마크(MSRB)를 구축해 워크플로 전반의 대표 위험을 평가
- •S³가 안전 효과성과 유용성 보존 모두에서 기존 최신 기법들을 일관되게 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
$S^3$: Improving Agent Safety through Multi-Stage Defense
본문 미리보기
arXiv:2608.02683v1 Announce Type: new Abstract: Large Language Model (LLM) agents rely on multi-stage agentic workflows, with stages such as memory, planning, and tool execution, to accomplish complex tasks. However, risks may emerge at different stages, propagate across steps, and become difficult to detect and mitigate. Existing safety methods protect only isolated stages and are difficult to integrate, leaving agents without comprehensive protection throughout the workflow. To address these
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



