마스크 확산 언어모델(MDLM)이 에이전트 RL용 텍스트 기반 월드 모델로서 자기회귀(AR) 모델보다 우수하다는 연구다. 텍스트 월드 모델링을 초기 상태·과업 맥락·도구 스키마·도메인 규칙·조향 지시로 분해한 조향 가능한 전이 동역학 문제로 정식화하고, 9개 오픈소스 환경·12개 프론티어 모델 계열에서 23만 9,403개의 상태-행동 궤적을 구축했다. MDLM은 양방향 앵커 인지 디노이징 덕분에 4배 이상 큰 AR 모델보다 일관성·근거성·롤아웃 다양성이 뛰어났고, 결정론적 상태 검사를 갖춘 GRPO 학습 프레임워크로 ScienceWorld·ALFWorld·AppWorld 등 OOD 환경 3종에서 환경별 파인튜닝 없이 최대 47%p의 절대 성능 향상을 달성했다. 손수 만든 고정 환경의 한계를 넘어 RL 학습 환경 다양성을 온디맨드로 확장할 길을 제시하며, 전체 작업은 오픈소스로 공개됐다.
- •텍스트 월드 모델링을 초기 상태·도구 스키마·도메인 규칙·조향 지시로 분해된 전이 동역학 문제로 정식화
- •9개 환경·12개 모델 계열에서 239,403개 상태-행동 궤적 데이터셋 구축
- •MDLM의 양방향 앵커 인지 디노이징이 4배 이상 큰 AR 모델보다 일관성·근거성·롤아웃 다양성 우수
- •GRPO 프레임워크로 OOD 환경 3종(ScienceWorld·ALFWorld·AppWorld)에서 최대 47%p 절대 향상
- •1.2B~7B 에이전트 백본 3종 검증, 적대적 시나리오 실패 모드 분석 포함 오픈소스 공개
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- 1.마스크드 확산 언어모델(MDLM)이 에이전트 RL용 텍스트 월드모델로 AR 모델보다 우수함을 입증
- 2.9개 오픈소스 환경·12개 프런티어 모델군에서 23.9만 개 상태-행동 굤적 데이터 구축
- 3.양방향 앵커 인식 디노이징으로 4배 큰 LLM보다 일관성·근거성·롤아웃 다양성 우위
- 4.ScienceWorld·ALFWorld·AppWorld 제로샷 전이에서 최대 47%p 절대 성능 향상, 오픈소스 공개
왜 중요한가?
RL 학습 환경을 손으로 만드는 대신 월드모델로 무한히 생성하려는 흐름에서, 툴 스키마·기대 결과 같은 전역 앵커 조건화에 AR 모델의 좌→우 편향이 걸림돌임을 짚고 확산 모델이 그 대안임을 실증했다. 에이전트 RL 스케일링의 환경 병목을 푸는 방향성이다.
본문 미리보기
arXiv:2607.16204v1 Announce Type: new Abstract: Recent growth in reinforcement learning (RL) has surfaced a need for diverse, specialized training environments. Hand-curated environments with fixed task and reward difficulties become ineffective signals as model performance improves, and sparse rewards over long horizons induce mode collapse on specific workflows or tool structures. World models that simulate environment states have matched pure rollout performance, making them promising for sc
전체 내용이 궁금하다면?
원문을 직접 읽어보세요