이 논문은 보상 없는 잠재 세계모델이 후보 행동을 잠재공간 거리로 점수화해 계획을 세우는 방식이 '잠재적 근접성이 실제 비용 순서와 일치한다'는 암묵적 가정에 의존한다는 점을 지적하고, 이를 직접 검증하는 무누출·고정 후보 프로토콜인 ARC-Bench를 제시한다. 공식 공개된 JEPA 세계모델 체크포인트를 내비게이션과 조작 제어 과제에 적용한 결과, 이 가정은 심각하고 구조적으로 실패했다. 조작 과제 감사에서는 최고 점수 후보가 거의 항상 최적이 아니었고, DINOv2를 비디오 사전학습 인코더로 바꿔도 결함이 지속됐다. 재계획 빈도를 낮추면 성공률이 붕괴한다는 사실을 밝혀, 폐쇄 루프 재계획이 이 결함을 은폐해왔음을 보여준다.
- •잠재 세계모델의 '거리=비용 순서' 가정을 검증하는 ARC-Bench 프로토콜 제안
- •공식 JEPA 체크포인트 감사 결과 조작 과제에서 최고점 후보가 거의 항상 최적이 아님
- •인코더를 바꿔도 결함이 지속되는 구조적 문제임을 확인
- •잦은 재계획(폐쇄 루프)이 결함을 은폐해 기존 성공률이 순위화 능력을 과대평가해왔음을 규명
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ARC-Bench: Closed-Loop Replanning Masks Broken Action Ranking in Frozen JEPA World Models
- 1.동결된 JEPA류 잠재공간에서 행동 순위가 실제 비용 순위와 일치하는지 검증하는 'ARC-Bench' 제안
- 2.공식 공개 JEPA-WM 체크포인트로 내비게이션·조작 과업 감사, 최상위 점수 후보가 대부분 최적이 아님을 확인
- 3.DINOv2를 V-JEPA 1·2(ViT-L/G)로 교체해도 동일한 결함이 지속됨을 확인
- 4.재계획 빈도를 낮추면 성공률이 급락해, 폐루프 재계획이 잠재공간의 순위결함을 은폐해왔음을 규명
왜 중요한가?
널리 쓰이는 프론티어 월드모델의 잠재공간 거리가 실제로는 행동 순위를 신뢰성 있게 매기지 못한다는 구조적 결함을 밝혀, 관련 플래닝 시스템 설계에 재검토가 필요함을 시사한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05461v1 Announce Type: new Abstract: Reward-free latent world models plan by scoring candidate actions with distances in a frozen latent space: an action is preferred if its predicted future embedding lands closer to the goal embedding. This silently assumes that latent closeness is action-rankable, i.e., that ordering candidates by latent distance agrees with ordering them by true cost. We audit this assumption directly. We introduce ARC-Bench, a no-leak, fixed-candidate protocol th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

