WebRider는 웹 작업을 위임할 때 최종 답변만으로는 드러나지 않는 정책 위반 문제를 해결하는 프레임워크다. 실사용 감사 결과 강력한 컨트롤러가 작업의 99.2%를 완료했지만 위임된 정책 제약을 모두 지킨 경우는 38.8%에 불과했다. WebRider는 목표·제약·근거 확보 의무·답변 형식·페르소나 통제를 담은 '의도 계약(intent contract)'을 상단 컨트롤러가 유지하고, 중간 계층이 이를 실행 가능한 행동으로 구현하며, 도구 계층이 브라우저·검색·지도 도구로 실행하는 계층적 구조를 갖는다. 42개 공개 웹사이트에 걸친 4,096개의 실사용 웹 계약으로 구성된 RiderBench로 평가했으며, 이 인터페이스로 학습한 8B 파라미터 행동 정책 모델이 실행 전용 베이스라인을 능가했다. 최종 답변만 보는 기존 평가 방식의 맹점을 지적하고 감사 가능한 웹 에이전트 설계를 제시한다.
- •최종 답변 완료율 99.2%지만 정책 준수율은 38.8%에 불과함을 발견
- •목표·제약·근거의무를 담은 '의도 계약'을 상단 컨트롤러가 유지
- •42개 사이트·4,096개 실사용 웹 계약으로 구성된 RiderBench로 평가
- •이 인터페이스로 학습한 8B 행동 정책 모델이 실행 전용 베이스라인 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance
본문 미리보기
arXiv:2608.06704v1 Announce Type: new Abstract: Delegating a web task involves more than asking a question; it requires transferring a policy: what to verify, how to handle uncertainty, which preferences matter, and when to stop. Yet, current live-web agents are evaluated solely on the final answer, ignoring the policy constraints that define the delegation. A plausible final answer can conceal violations of that policy. Our full live audit reveals this critical gap: a strong controller complet
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

