도구를 사용하는 LLM 에이전트가 사용자가 부여하지 않았거나 작업에 불필요한 권한을 행사하는 '과잉권한 오류'를 줄이기 위해, 이 연구는 40억 파라미터 모델에 작업 조건부 최소권한 선택을 사후학습으로 가르칠 수 있는지 검증했다. 각 행동을 실행 전후로 완료도·증거·정확 상태·금지 시도·안전 성공 등 6개 위험 차원에서 결정론적 검증기로 감사하고, 작업별 초과권한 값을 계산해 최적화에 반영했다. Qwen3.5-4B를 1,500개 작업으로 학습한 결과 2,896개 평가 에피소드에서 안전 성공률이 기존 64.36%에서 98.48%로 오르고 과잉권한 오류는 4.56%에서 0.79%로 줄었다. 별도의 400개 작업 후속 연구에서도 일반화 효과가 확인돼, 학습된 절제가 권한 게이트·샌드박싱을 대체하진 못해도 유용한 추가 통제층이 될 수 있음을 보여준다.
- •도구 사용 LLM 에이전트의 '과잉권한 오류'를 줄이는 작업조건부 최소권한 사후학습 제안
- •6개 위험 차원의 결정론적 검증기로 행동 실행 전후를 감사
- •Qwen3.5-4B 학습 후 안전 성공률 64.36%→98.48%, 과잉권한 오류 4.56%→0.79%
- •400개 작업 후속 실험에서도 일반화되며 기존 권한 게이트·샌드박싱을 보완
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents
- 1.4B 파라미터 Qwen3.5 모델에 과잉권한 행사를 줄이는 태스크조건부 최소권한 포스트트레이닝 적용
- 2.완료·근거·정확상태·금지시도·안전성공 등 6개 위험축을 결정론적 검증기로 실행 전후 감사
- 3.1500개 태스크 학습 후 2896개 평가 에피소드서 안전성공률 64.36%→98.48%로 향상
- 4.과잉권한 오류 4.56%→0.79%로 감소, 400개 신규 태스크서도 6.99%p 추가 감소로 일반화 확인
왜 중요한가?
권한 게이팅·샌드박싱만으로는 부족한 터미널·MCP 에이전트의 과잉권한 문제를, 태스크별 충분권한 범위를 정의하고 포스트트레이닝으로 절제된 행동을 학습시켜 보완하는 추가 통제 계층으로 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.18351v1 Announce Type: new Abstract: Tool-using large language-model agents can complete a task while exercising authority that the user did not grant or the task does not need, causing excess-authority errors. Traditional permission gating systems alone for validating agent environments are insufficient. We study whether post-training can teach a 4B-parameter model to choose task-conditioned authority in executable terminal and Model Context Protocol (MCP) environments to complement
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

