연구진은 로봇 등 실체화 에이전트용 세계모델이 물리적으로 그럴듯한 상호작용을 만드는 데 어려움을 겪는 원인을 전역 평균 MSE 디노이징 목표함수의 '지도 할당 불균형'에서 찾았다. 정적인 배경 콘텐츠가 최적화 신호를 지배하면서, 상호작용에 결정적인 희소한 동적 객체 영역이 상대적으로 덜 학습되는 문제가 있었다. 이를 해결하기 위해 제안된 IMPACT는 외부 표현이나 추가 주석 없이, 조작 대상 토큰과 연관된 크로스어텐션을 행동 조건부 변화의 내부 시공간 사전지식으로 활용해 후보 영역을 샘플링하고 지역 예측 오차로 보정해 상호작용 맵을 만든 뒤 이를 디노이징 지도에 가중치로 반영한다. 로봇 팔과 사람 손 조작 실험에서 다양한 제어 방식과 DiT 백본에 걸쳐 IMPACT는 기존 MSE 학습 기준선을 일관되게 능가하며 상호작용 충실도, 물리적 타당성, 시각적 품질을 모두 개선했다.
- •전역 평균 MSE 목표함수가 정적 배경에 편향되어 동적 객체 영역이 저평가되는 문제 확인
- •외부 표현이나 수동 주석 없이 크로스어텐션을 내부 사전지식으로 활용하는 IMPACT 제안
- •지역 예측 오차로 보정한 상호작용 맵으로 디노이징 지도를 재가중치
- •로봇 팔·사람 손 조작 실험에서 기존 MSE 기벘대비 상호작용 충실도·물리적 타당성·화질 모두 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
- 1.IMPACT는 월드모델 MSE 학습에서 정적 배경이 손실신호를 지배해 동적 영역이 과소학습되는 문제를 지적
- 2.조작 토큰의 크로스어텐션을 시공간 프라이어로 활용, 국소 오차로 보정한 상호작용 맵으로 지도신호 재가중
- 3.외부 모션·기하 표현이나 별도 추정기, 추론 시점 수정 없이도 적용 가능
- 4.로봇팔·손 조작 실험과 다양한 DiT 백본에서 기존 MSE 기준선 대비 전방위 성능 개선
왜 중요한가?
외부 주석이나 별도 추정기 없이 학습 목적함수만 바꿔 월드모델의 상호작용 표현력을 높였다는 점에서, 로봇 조작 시뮬레이션과 액션 조건부 예측 모델의 확장성 있는 개선 경로를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2609.00161v1 Announce Type: new Abstract: World models have made remarkable progress in action-conditioned future prediction for embodied agents, yet still struggle to model physically plausible interactions. Existing approaches address this limitation by constraining the generation process with external representations encoding motion, geometry, or semantics. Obtaining these spatiotemporally dense representations typically requires auxiliary estimators or manual annotations, limiting tra
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
