실제 컴퓨터 환경에서 작동하는 LM 에이전트의 사후 안전 장치 부재 문제를 다루며, 유해 상태에서 안전 상태로 복원하는 '해악 회복(harm recovery)' 과제를 정의한다. 사용자 연구로 가치 있는 회복 차원과 자연어 평가 루브릭을 도출하고, 1,150개 쌍 비교 데이터셋으로 맥락 의존적 우선순위(예: 포괄적 장기 전략보다 실용적·표적적 전략 선호)를 분석한다. 이러한 통찰을 보상 모델로 운영하여 다수의 회복 계획을 재순위화한다. 50개 컴퓨터 사용 과제의 BackBench 벤치마크에서 제안 방식이 기본 에이전트와 루브릭 기반보다 높은 품질의 회복을 달성했다.
- •예방 실패 후 아기 행동을 복원하는 해악 회복 문제를 형식화
- •사용자 선호 루브릭과 1,150개 쌍 판단 데이터셋 구축
- •보상 모델로 후보 회복 계획을 테스트 시점에 재순위화
- •BackBench(50 과제)에서 기본 에이전트·루브릭 대비 높은 품질 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Human-Guided Harm Recovery for Computer Use Agents
- 1.실행 후 피해 완화 문제를 harm recovery로 정식화
- 2.사용자 연구로 복구 차원과 자연어 루브릭 도출, 1150쌍 판단 데이터셋 구축
- 3.보상 모델로 후보 복구 계획을 재순위해 선호 정렬된 복구 유도
- 4.BackBench 50개 컴퓨터 사용 작업으로 서널 에이전트보다 우수함을 입증
왜 중요한가?
사전 방어를 넘어 사후 복구까지 포함하는 새로운 에이전트 안전 방법론을 제시해 실운영 환경의 리스크 관리에 기여
언급 프로젝트
본문 미리보기
arXiv:2604.18847v1 Announce Type: new Abstract: As LM agents gain the ability to execute actions on real computer systems, we need ways to not only prevent harmful actions at scale but also effectively remediate harm when prevention fails. We formalize a solution to this neglected challenge in post-execution safeguards as harm recovery: the problem of optimally steering an agent from a harmful state back to a safe one in alignment with human preferences. We ground preference-aligned recovery th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

