연구진은 생성된 실행 가능한 세계를 편집하는 능력을 '세계 편집(World Editing)'이라는 새로운 과제로 정의하고, 편집이 세계의 개체·동역학·시스템에 얼마나 깊게 개입하는지를 나타내는 '개입 깊이' 축을 제시했다. 마인크래프트와 테라리아를 활용한 산업급 게임 모딩 벤치마크 IGMBench를 구축해 110개 과제와 1,100개 이상의 실행·행동 기준으로 평가했으며, 최상위 코딩 에이전트 구성은 엄격한 과제 단위 기준에서 78.2%, 세부 기준 단위에서는 94.8%의 성공률을 보였다. 다만 개입 깊이가 깊어질수록 신뢰도가 떨어지고, 실패한 편집 대부분은 빌드와 로드까지는 성공하지만 의도대로 작동하지 않는 경우였으며, 시각적 일관성은 모든 평가 구성에서 50% 미만에 그쳐 별도의 약점으로 지적됐다.
- •'개입 깊이' 축으로 세계 편집 작업을 체계화, 마인크래프트·테라리아 기반 IGMBench(110개 과제) 도입
- •최상위 프런티어 코딩 에이전트가 과제 단위 78.2%, 세부 기준 단위 94.8% 성공률 달성
- •개입 깊이가 깊어질수록 신뢰도 저하, 실패 편집 대부분은 빌드는 성공하나 동작이 의도와 다름
- •시각적 일관성은 모든 설정에서 50% 미만으로 가장 취약한 영역으로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
World Editing: Intervening on Executable Worlds at Increasing Depth
- 1.실행 가능한 월드를 직접 편집하는 능력을 '개입 깊이(intervention depth)'라는 새 축으로 정의
- 2.마인크래프트·테라리아 기반 IGMBench(110개 과제, 1,100개 이상 평가 기준)로 코딩 에이전트의 월드 편집력을 측정
- 3.가장 강력한 구성이 과제 단위로는 78.2%, 세부 기준 단위로는 94.8%를 달성
- 4.편집된 월드는 대부분 빌드·로딩에는 성공하지만, 시각적 일관성 통과율은 모든 설정에서 50% 미만
왜 중요한가?
월드를 새로 만드는 것과 기존 월드를 의도대로 고치는 것은 전혀 다른 능력이라는 점을 수치로 입증해, 게임·시뮬레이션용 코딩 에이전트 평가에 새로운 기준축을 제시한다.
본문 미리보기
arXiv:2610.02331v1 Announce Type: new Abstract: Interactive world models are increasingly capable of generating environments and acting within them, yet deliberately editing an existing executable world remains underexplored. We formulate world editing as intervening on an existing world while preserving properties that should remain unchanged, and introduce intervention depth as an axis describing how strongly an edit couples world entities, dynamics, and systems. We instantiate this capabilit
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

