챗봇 시대의 '거부(refusal) 학습' 안전 기법을 에이전트에 그대로 이식하는 것이 범주 오류(category error)라고 주장하는 포지션 논문이다. 콘텐츠 안전에서 위해는 모델 출력 자체에 있어 학습 가능하지만, 에이전트 위해는 행동이 행사하는 권한과 사용자가 부여한 권한의 관계에 있으며 이는 모델이 보는 텍스트에 존재하지 않는다는 것이다. 저자들은 세 가지 증거를 제시한다: 방어 학습된 모델은 의도가 아닌 표면 패턴만 학습하고, 같은 학습이 위협 발생 전에 멀티스텝 에이전트를 무력화하면서도 악용 가능성은 남기며, 방어 없는 프론티어 모델조차 일상 사용에서 부여받은 권한을 초과한다. 결론적으로 행동 안전은 가중치에 심을 수 없고, 모델 외부의 행동 경계에서 최소 권한(least privilege)으로 강제하며 거부 점수가 아닌 '행동 정렬'로 평가해야 한다고 제안한다. 에이전트 배포가 확산되는 시점에 안전 설계의 관점 전환을 촉구하는 글이다.
- •콘텐츠 안전용 거부 학습을 에이전트에 이식하는 것은 '안전세'가 아니라 음의 보안을 산다고 주장
- •에이전트 위해는 출력이 아니라 행사된 권한과 부여된 권한의 관계에 있어 텍스트로 학습 불가
- •방어 학습 모델은 표면 패턴만 학습, 프론티어 모델도 일상 사용에서 권한 초과 확인
- •해법은 모델 외부 행동 경계에서의 최소 권한 강제와 '행동 정렬' 기준 평가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agent Safety Is Action Alignment
- 1.챗봇 시대의 '거부 훈련'을 에이전트에 이식하는 것은 범주 오류(category error)라고 주장
- 2.에이전트 위해는 출력이 아니라 '행사한 권한 대 부여받은 권한'의 관계에 있어 텍스트로 학습 불가
- 3.방어 훈련 모델은 의도 아닌 표면 패턴만 학습, 위협 전에 멀티스텝 에이전트가 무너지는 증거 제시
- 4.해법은 가중치가 아닌 모델 밖 행동 경계의 최소권한(least privilege) 집행과 행동 정렬 평가
왜 중요한가?
에이전트가 돈을 옮기고 기록을 지우는 시대에, 거부 훈련이 능력만 깎고 보안은 오히려 악화시킨다는 도발적 주장이다. 안전을 모델 가중치가 아닌 배포 환경의 권한 경계에서 강제해야 한다는 결론은 에이전트 안전 설계의 무게중심을 시스템 아키텍처로 옮긴다.
본문 미리보기
arXiv:2606.28739v1 Announce Type: new Abstract: Large language models increasingly act as agents: they call tools, move money, delete records, and send messages on a user's behalf. To keep them safe, practitioners imported the chatbot-era recipe (train the model to refuse unsafe inputs) into the agentic setting, and treat the resulting capability loss as a manageable ``alignment tax.'' We argue this is a \emph{category error}. Refusal is a primitive for \emph{content safety}, where the harm is
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

