어떤 행동을 선호하는지 사람에게 묻는 비교 피드백은 보상함수를 직접 지정할 수 없을 때 로봇과 에이전트 행동을 인간 의도에 맞추는 표준적 방법이 됐다. 그러나 기존 선호 기반 보상학습은 교사를 학습자가 생성한 질의에 답하는 수동적 오라클로만 다뤄, 목표를 아는 교사의 강점을 살리지 못한다는 것이 이 논문의 문제의식이다. 연구진은 선호 학습을 인간-자율 팀 문제로 재구성해, 교사는 학습자 모델을 유지하며 커리큘럼을 설계하고 학습자는 교사 모델에 대한 2차 이론(ToM-2) 모델을 유지하며 이해 진술을 통해 교사의 학습자 모델을 동기화한다. 시뮬레이션 결과 정보를 가진 교사는 학습자 주도 선택보다 우수한 성능을 보였고, 교사가 번갈아 바뀔 때 발생하는 모델 표류는 이 이점을 약화시켰지만 이해 진술이 이를 회복시켰다. 특히 교사의 오차가 특정 방향에 집중될 때는 2차 이해 진술이 평균 신념 진술보다 더 우수한 성능을 보였다.
- •목표를 아는 교사가 학습자 모델을 활용해 능동적으로 커리큘럼을 설계하는 인간-자율 팀 프레임워크 제안
- •학습자는 교사에 대한 2차 이론(ToM-2) 모델을 유지하며 '이해 진술'로 동기화 유지
- •정보를 가진 교사가 학습자 주도 선택보다 우수, 교사 교체 시 모델 표류로 이점 약화
- •이해 진술이 표류로 인한 손실을 회복시키며, 오차가 편향된 경우 2차 진술이 더 효과적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)
본문 미리보기
arXiv:2608.11229v1 Announce Type: new Abstract: Comparative feedback, asking people which of two behaviors they prefer, has become a standard way to align robot and agent behavior with human intent when the reward itself cannot be specified directly. Preference-based reward learning typically casts the human teacher as a passive oracle answering learner-generated queries. We argue this forfeits the teacher's defining advantage: knowledge of the objective. A teacher who knows the target can cons
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

