실제 권한(명령 실행, 파일 수정, API 호출)을 부여받은 LLM 에이전트는 오류가 나면 이미 행동이 실행된 상태라는 문제에서, 저자들은 후보 행동에서 권한이 있는 효과로 이어지는 경로를 모델 밖에서 통제해야 한다고 주장하며 플래너·정책 게이트·실행자·감사자 네 역할을 두는 아키텍처를 제시한다. 핵심은 행동을 구조화된 의도로 전달해 셸 구문을 파싱하지 않고 판정하는 것과, 실행될 정확한 바이트에 묶인 1회용 승인 자격증명이다. 313개 사례, 2,250회 시도 평가에서 공격 성공률이 직접 실행 시 98.3%에서 배포 후 7.7%로 떨어졌고, 설계 검토가 아닌 벤치마크에서만 발견된 구현 결함 4건도 확인됐다.
- •플래너·정책 게이트·실행자·감사자 4역할로 행동-효과 경로를 모델 외부에서 통제하는 아키텍처 제안
- •구조화된 의도 전달(셸 구문 미파싱)과 실행 바이트에 묶인 1회용 승인 자격증명이 핵심
- •313개 사례, 2,250회 시도 평가에서 공격 성공률 98.3%→7.7%로 감소
- •운영체제 샌드박스가 최종 단계 공격률을 30.8%에서 7.7%로 낮췄고, 설계 검토로는 못 찾은 구현 결함 4건 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Separation of Duties for Privileged LLM Agents: A Governed Execution Architecture with Measured Security-Utility Trade-offs
- 1.플래너·정책게이트·실행자·감사자 4역할로 권한을 분리한 특권 LLM 에이전트 거버넌스 아키텍처 제안
- 2.행동을 구조화된 의도로 전달, 실행될 정확한 바이트에 묶인 1회용 자격증명으로 승인
- 3.313개 사례·8개 변형 실험에서 공격 성공률을 직접 실행 98.3%에서 배포 환경 7.7%로 낮춤
- 4.최종 단계 감소(30.8%→7.7%)는 주로 OS 샌드박스 기여, 설계 검토가 놓친 구현 결함 4건도 발견
왜 중요한가?
입력 방어만으로는 한계가 있다는 전제 아래, 승인된 행동이 실제로 실행되는 경로 자체를 운영체제 수준에서 통제함으로써 특권 작업의 공격 성공률을 실질적으로 낮출 수 있음을 수치로 보여준다.
본문 미리보기
arXiv:2609.38224v1 Announce Type: new Abstract: Large language model agents are increasingly granted real privileges (executing commands, modifying files, calling APIs), so an agent that errs has already acted. Existing defences concentrate on the agent's inputs, while the path from a candidate action to privileged side effects remains less directly studied. We argue that this path must be governed outside the model, and study an architecture interposing four roles (planner, policy gate, execut
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

