WM-R1은 실제 환경과의 상호작용 없이 세계 모델(world model)을 활용해 모바일 GUI 에이전트를 강화학습으로 훈련하는 최초의 프레임워크다. 기존 강화학습은 실제 안드로이드 환경과의 방대한 상호작용이 필요해 자원 비용이 높고 불안정했는데, WM-R1은 세계 모델을 상태 전이의 원천으로 삼아 실제 환경을 훈련 루프에서 대체한다. 또한 세계 모델을 사고 과정에 직접 결합해 에이전트가 행동을 결정하기 전에 후보 행동의 결과를 추론할 수 있게 하며, 과제 성공·경로 효율성·세계 모델 활용도를 동시에 최적화하는 다차원 규칙 기반 보상을 도입했다. 2,000개의 고난도 과제로 구성된 데이터셋으로 훈련한 결과, 안드로이드 모바일 벤치마크에서 GRPO 단독 기준선과 추론 시점 시뮬레이션 방식을 모두 크게 상회하는 성능을 보였다.
- •실제 환경 상호작용 없이 세계 모델로 모바일 GUI 에이전트를 훈련하는 첫 RL 프레임워크
- •세계 모델이 실제 안드로이드 환경을 대체해 상태 전이 제공, 자원 비용·불안정성 해소
- •사고 과정에 세계 모델을 결합해 행동 전 결과를 미리 추론
- •과제 성공·경로 효율성·모델 활용도를 함께 최적화하는 다차원 보상 도입
- •2,000개 고난도 과제 데이터셋으로 훈련, GRPO 기준선 대비 크게 우수한 성능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning
- 1.WM-R1: 실제 안드로이드 환경 대신 월드모델로 GUI 에이전트를 학습시키는 첫 강화학습 프레임워크 제안
- 2.월드모델이 롤아웃 중 상태전이를 대체해 실환경 없이 대규모 병렜·스텝단위 굤적 생성 가능
- 3.사고 과정에 월드모델을 직접 내장해 행동 실행 전 결과를 미리 추론하도록 설계
- 4.과제성공·굤적효율·월드모델 활용을 동시 최적화하는 다차원 보상과 2000개 고난도 과제로 학습, GRPO 단독 대비 성능 우위 입증
왜 중요한가?
실환경 상호작용에 드는 높은 자원 비용과 불안정성을 해결해, 모바일 GUI 에이전트 강화학습의 확장성과 효율성을 크게 개선할 수 있는 방법론을 제시한다.
본문 미리보기
arXiv:2608.27508v1 Announce Type: new Abstract: GUI agents trained with reinforcement learning (RL) have showcased strong environment learning capabilities on mobile platforms. However, RL typically demands extensive real-environment interactions, leading to high resource costs and instability, especially in GUI scenarios. To address these, we propose WM-R1, the first reinforcement learning framework that trains mobile GUI agents with world models instead of real environments. Specifically, wor
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
