연구진이 로봇 제어를 위한 월드 액션 모델의 새로운 방식인 'ProWAM(Progressive World Action Model)'을 제안했다. 기존 방식은 전체 비디오를 생성하거나 단일 미래 프레임만 예측해 장기 목표로의 진행 과정을 놓쳤지만, ProWAM은 행동과 함께 희소한 시각적 하위 목표들의 순서를 동시에 예측해 행동 생성을 명시적으로 안내한다. 한 번의 비디오 백본 순전파로 하위 목표 특징을 캐싱해 반복적인 전체 비디오 생성 없이도 재계획 시 가벼운 행동 디노이징만 필요하게 만들어 효율을 높였다. LIBERO-Plus(85.8%)와 무작위화된 RoboTwin(75.7%)에서 최고 성능을 기록했고, 실제 환경 제로샷 실험에서는 최강 베이스라인보다 15%포인트 높은 70.0%의 성공률을 보였다.
- •행동과 희소 시각적 하위 목표 순서를 함께 예측해 장기 로봇 제어 계획을 명시적으로 안내
- •한 번의 비디오 백본 순전파로 하위 목표를 캐싱, 반복적 전체 비디오 생성 없이 효율적 재계획
- •LIBERO-Plus 85.8%, RoboTwin 75.7%로 최신 기법 대비 최대 35.9% 상대적 성능 향상
- •실제 환경 제로샷 실험에서 70.0% 성공률로 최강 베이스라인보다 15%포인트 높음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
World Action Modeling with Progressive Visual Planning
- 1.ProWAM은 액션과 희소한 시각적 서브골 시퀀스를 함께 예측해 긴 호라이즌 로봇 제어 문제를 해결
- 2.LIBERO-Plus 85.8%, RoboTwin 75.7% 성공률로 기존 최강 베이스라인 대비 최대 35.9% 상대 개선
- 3.실제 환경 제로샷 실험에서 55.0%→70.0%로 성공률을 15.0%포인트(상대 27.3%) 끌어올림
- 4.비디오 전체를 반복 생성하지 않고 희소 서브골 특징만 캐싱해 액션 생성을 가볍게 만듦
왜 중요한가?
로봇이 영상 전체를 매번 다시 생성하지 않고도 목표 지점을 향해 단계적으로 계획을 세우게 해, 긴 작업을 수행하는 월드 액션 모델의 효율과 실제 환경 적응력을 동시에 끌어올린 결과다.
본문 미리보기
arXiv:2610.02508v1 Announce Type: new Abstract: World action models (WAMs) have emerged as a promising paradigm for robotic control by jointly predicting future visual dynamics and actions from an initial observation and instruction. However, existing WAMs struggle with long-horizon prediction, as generating dense video rollouts is highly inefficient. Some recent WAMs address this by predicting a single future frame without generating the full video, but this approach neglects how to progress t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

