Sony AI가 강화학습 에이전트의 행동 '스타일'을 사용자가 실시간으로 조정할 수 있는 코칭 가능(coachable) 에이전트 프레임워크를 발표했다. RL이 보통 하나의 준최적 행동만 학습하는 것과 달리, 범용 가치 함수 근사기(UVFA)에 신중히 설계된 학습 시나리오, 학습 알고리즘, 데이터 증강을 결합해 핵심 과제를 유지하면서 다양한 스타일을 표현하게 했다. AAA 게임인 Horizon Forbidden West와 Gran Turismo, 오픈소스 휴머노이드 보행 도메인에 적용한 결과, 자동차 레이싱·양식화된 전투·휴머노이드 보행이라는 서로 다른 도메인 모두에서 에이전트가 스타일 요청에 강하게 부합하면서 본 과제도 수행했다. 최종 행동을 런타임에 사용자가 선택할 수 있어, 게임 AI와 로보틱스에서 획일적 최적 행동을 넘어선 유연한 제어 가능성을 보여준다. 저자 49명이 참여한 대규모 산업 연구다.
- •RL 에이전트가 하나의 최적 행동만 배우는 한계를 넘어 '스타일'을 런타임에 제어하는 프레임워크
- •UVFA + 맞춤 학습 시나리오 + 데이터 증강의 조합으로 구현
- •Horizon Forbidden West·Gran Turismo 등 AAA 게임과 휴머노이드 보행 도메인에서 실증
- •서로 다른 세 도메인 모두에서 스타일 요청 부합성과 본 과제 수행을 동시 달성
- •Sony AI 취리히·북미·도쿄 연구진 49명 참여의 대규모 산업 연구 — 상용 게임 AI 적용 사례
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Coachable agents for interactive gameplay
- 1.강화학습 에이전트에 실시간으로 '스타일'을 지정·제어하는 코칭 프레임워크 제안
- 2.UVFA와 선별된 훈련 시나리오·데이터 증강을 결합해 핵심 과제 수행 중 스타일 반영
- 3.Horizon Forbidden West·Gran Turismo 등 AAA 게임과 휴머노이드 도메인서 검증
- 4.사용자가 런타임에 최종 행동 스타일을 직접 선택하는 유연한 제어 실현
왜 중요한가?
기존 RL 에이전트는 하나의 최적 행동만 학습해 실행 방식을 바꾸기 어려웠는데, 런타임 스타일 제어로 게임·로보틱스에서 사용자 맞춤 행동을 즉시 조정할 수 있게 한 점이 실용적이다.
본문 미리보기
arXiv:2607.00642v1 Announce Type: new Abstract: Reinforcement learning has proven to be a valuable tool in the creation of advanced AI and robotic systems, contributing to everything from game playing to robotics to foundation models. Through trial-and-error, these AI systems typically learn one, near-optimal behavior to solve their tasks. However, there are many use cases in which one would like to assert some level of control, preferably in real time, over how the task is solved. We refer to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

