에이전틱 도구 사용에서의 신뢰 보정 문제, 즉 언제 자율 실행하고 언제 인간 승인을 받을지 결정하는 문제를 선호 학습 문제로 형식화했다. 정책 게이트웨이는 이진 승인/거부 피드백으로부터 잠재적 인간 위험 허용 함수에 대한 가우시안 프로세스 사후 분포를 유지한다. 이 구조는 선호 베이지안 최적화의 인스턴스로, 승인 결과가 불확실한 지점을 우선 질의해 샘플 효율성을 달성하며 행동 공간을 허용/차단/요청 세 영역으로 분류한다.
- •에이전틱 도구 사용의 신뢰 보정을 선호 학습 문제로 공식적으로 형식화
- •이진 피드백으로부터 잠재적 위험 허용 함수에 대한 가우시안 프로세스 사후 분포 유지
- •승인 결과가 불확실한 지점 우선 질의하는 불확실성 기반 쿼리로 샘플 효율성 달성
- •행동 공간을 허용/차단/요청 세 영역으로 분류하는 선호 베이지안 최적화 구조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Progressive Autonomy as Preference Learning: A Formalization of Trust Calibration for Agentic Tool Use
- 1.에이전트 툴 사용에 대한 신뢰 보정을 선호도 학습 문제로 형식화하는 연구
- 2.가우시안 프로세스 사후 분포로 인간 위험 허용 함수를 모델막하곰 불확실성 타겟 향 인간 주돉 결정
- 3.구조적으로 선호 베이즈 최적화의 인스턴스로 행동 공간을 허용/차단/다시확인 영역으로 분류
왜 중요한가?
에이전트가 자율적으로 행동할 때 언제 인간 승인이 필요한지를 원칙적으로 결정하는 프레임워크로, 안전한 AI 에이전트 배포의 신뢰 보정 문제에 이론적 기반을 제공한다.
본문 미리보기
arXiv:2605.19151v1 Announce Type: new Abstract: We formalize trust calibration for agentic tool use (deciding when an automated agent's proposed action may execute autonomously versus require human approval) as a preference-learning problem. A policy gateway maintains a Gaussian-process posterior over a latent human risk-tolerance function, observed through a probit likelihood on binary approve/deny feedback, and escalates to the human exactly where the approval outcome is most uncertain. We sh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

