EBM-RL(Eye-Brain-Mouth 강화 학습)은 비디오 기반 롤플레잉 대화에서 지각([인식]), 추론([생각]), 발화([답변])를 명시적으로 분리하는 디커플드 GRPO 기반 프레임워크이다. CLIP 기반 장면-텍스트 정렬, 지각-인지 보상, 답변 정확성, 형식 보상의 4가지 보완적 보상으로 시각적 분위기 일관성과 캐릭터 진정성을 동시에 향상시킨다. 텍스트 전용 롤플레잉 기준선과 더 큰 비전-언어 모델을 능가하며, 추가 파인튜닝 없이 외부 도메인 VideoQA 벤치마크에서도 강한 제로샷 일반화를 보인다.
- •텍스트 기반 롤플레잊 모델은 캐릭터 스타일을 모방하는 데 그치지만 장면 분위기와 긴장감을 반영하지 못한다.
- •EBM-RL은 지각·추론·발화를 명시적으로 분리해 인간과 유사한 감각 접지를 촉진한다.
- •CLIP 장면-텍스트 정렬, 지각-인지, 답변 정확성, 형식 보상 4가지로 시각적 분위기와 캐릭터 진정성을 동시에 향상시킨다.
- •추가 파인튜닝 없이 외부 도메인 VideoQA 벤치마크에서도 일관된 성능 향상을 보이는 강한 제로샷 일반화를 나타낸다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
- 1.비디오 기반 롤플레잌 대화를 위한 EBM-RL 프레임워크 소개(Eye-Brain-Mouth 강화학습)
- 2.지각·추론·발화를 분리해 시각적 단서 먼저 처리 후 맥락에 맞는 대화 생성
- 3.CLIP 기반 장면-텍스트 정렬 등 4가지 보완적 보상으로 VR 게임과 내러티브에 적합
- 4.텍스트 전용 기준선 대비 우수, 외부 도메인 VideoQA에서 제로샷 일반화 입증
왜 중요한가?
VR 게임·인터랙티브 내러티브 등 몰입형 응용에서 장면의 분위기와 긴장감을 반영하는 롤플레잉 모델 개발은 차세대 멀티모달 에이전트의 핵심 과제다.
언급 프로젝트
본문 미리보기
arXiv:2605.04733v1 Announce Type: new Abstract: Text-based role-playing models can imitate character styles, yet they often fail to reflect a scene's atmosphere and evolving tension, both essential for immersive applications such as Virtual Reality (VR) games and interactive narratives. We study video-grounded role-playing dialogue and introduce EBM-RL (Eye-Brain-Mouth Reinforcement Learning), a decoupled GRPO-based framework that explicitly separates observation ([perception]), reasoning ([thi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

