DROPJ는 환경 동역학을 모르고 적절한 보상 함수도 없는 안전 필수 환경에서 인간 입력으로 에이전트를 안전하게 학습·배포하는 방법이다. 과거 실제 궤적 데이터로 월드 모델(학습된 시뮬레이터)을 만들고, 인간이 그 시뮬레이터에서 직접 플레이해 정보량 높은 시뮬레이션 궤적을 뽑은 뒤, 궤적 구간 쌍에 대한 선호와 그 이유(정당화)를 함께 수집해 보상 모델을 학습한다. 이 보상 모델과 월드 모델을 결합해 모델 예측 제어(MPC)로 에이전트를 바로 배포한다. 실사용자 실험에서 사용자 생성 궤적이 학습 계산 비용을 크게 줄이고 배포 성능도 높였으며, 다른 피드백보다 선호 기반 피드백이 성능을 크게 개선했다. 특히 선호에 딸린 안전 정당화가 배포 시 안전성을 높이거나 사용자가 지정한 안전 측면을 우선시하게 만들어, 인간 피드백 기반 안전 RL의 실용 경로를 보여준다.
- •보상 함수 없는 안전 필수 환경을 위해 월드 모델+인간 플레이+정당화 달린 선호로 보상 모델을 학습하는 DROPJ 제안
- •학습된 보상 모델과 월드 모델을 결합해 모델 예측 제어(MPC)로 직접 배포
- •사용자가 생성한 정보량 높은 시뮬레이션 굤적이 학습 계산 비용을 유의미하게 절감하고 배포 성능도 개선
- •다른 피드백 유형보다 선호(preference) 기반 피드백이 배포 성능을 크게 향상
- •선호에 덧붙인 안전 정당화가 배포 시 안전성 강화 및 사용자 지정 안전 측면 우선순위화에 효과적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models
- 1.보상 함수 없는 안전 중요 환경용 인간 중심 안전 학습·배포 기법 DROPJ 제안
- 2.실세계 궤적으로 월드 모델 학습 후 인간이 시뮬레이터에서 정보성 궤적 추출
- 3.선호+정당화(이유)로 보상 모델 학습, 월드 모델과 결합해 MPC로 직접 배포
- 4.실사용자 실험에서 훈련 비용 감소·성능 향상, 안전 정당화가 배포 안전성 강화
왜 중요한가?
환경 역학과 보상이 모두 미지인 안전 중요 도메인에서 실제 환경 시행착오 없이 정책을 학습·배포하는 경로를 제시했고, 특히 선호에 '이유'를 결합하면 사용자가 지정한 안전 측면을 우선시할 수 있음을 실사용자 실험으로 보였다.
언급 프로젝트
인간의 선호도와 정당화를 통해 AI 에이전트의 안전한 행동을 학습시키는 연구는 국내의 안전 최우선 AI 시스템 개발에 필수적인 접근 방식입니다. 자율주행, 의료 등 안전이 중요한 분야에서 신뢰할 수 있는 AI 배포를 위해, 이러한 안전 학습 방법론은 국내 AI 규제와 기술 발전에 중요한 기준을 제시할 것입니다.
본문 미리보기
arXiv:2607.13172v1 Announce Type: new Abstract: We address the problem of safely training an agent policy and deploying a good and safe policy, in settings where the environment dynamics are unknown and no suitable reward function is available. In the context of safety-critical environments, we consider traditional reinforcement learning impractical and resort to the resource of human input. We introduce DROPJ, a human-centred method for both safe training and deployment. We first learn a world
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

