언어 목표를 조건으로 받는 컴팩트 월드모델이 공간 관계를 실제로 '지각'하는 게 아니라 지시문을 베껴 쓰는 '지시 누출(instruction leakage)' 함정을 규명한 연구다. 목표 조건 예측기는 관계 판독 정확도 0.90을 기록했지만, 목표를 제거하면 0.27로 무작위 수준까지 붕괴했고, 반사실 지시문을 주면 94.5%가 거짓 지시를 따랐다. 저자들은 채점 대상이 지시문에서 그대로 전사 가능할 때 누출이 발생함을 3개 환경과 BabyAI 벤치마크에서 확인했다. 해결책은 목표를 다이내믹스에서 분리해 플래너의 비용 함수로 옮기고 읽기 경로를 감독하는 것으로, 목표 유무와 무관한 진짜 접지 성능 0.88을 회복했다. 언어 조건 월드모델 평가 전반에 적용 가능한 진단 프로토콜이라는 점에서 중요하다.
- •목표 조건 월드모델의 관계 판독 정확도 0.90이 실은 지시문 전사에 불과함을 발견
- •목표 제거 시 정확도 0.27로 붕괴, 반사실 지시문에는 94.5%가 거짓 지시를 추종
- •지시문이 채점 대상을 직접 명명할 때 누출 발생: BabyAI도 누출, Language-Table은 방향 명명 전까지 무누출
- •목표를 다이내믹스에서 제거하고 읽기 경로를 감독하는 수정으로 지시 독립적 접지 0.88 회복
- •언어 조건 월드모델 전반에 적용 가능한 누출 탐지 프로토콜 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix
- 1.목표 조건 세계모델의 관계 판독 정확도 0.90이 실은 지시문 '전사'였음을 규명
- 2.목표 제거 시 정확도 0.27로 붕괴, 반사실 지시문엔 94.5%가 거짓 지시를 따름
- 3.지시문이 정답을 직접 명명할 때 발생하는 '지시 누출' 혼입 변수를 정식화
- 4.목표를 동역학에서 빼고 판독 경로를 감독하면 0.88의 진짜 접지 회복
왜 중요한가?
세계모델·로봇 지시수행 벤치마크의 높은 점수가 지각 능력이 아닌 지시문 베끼기일 수 있음을 보여, BabyAI 등 기존 벤치마크 결과의 재검토와 평가 프로토콜 수정을 요구하는 발견이다.
언급 프로젝트
본문 미리보기
arXiv:2607.06925v1 Announce Type: new Abstract: Compact world models that condition on a language goal promise to ground relations such as ``put the red block left of the blue block'' using a sparse set of explicit \emph{reference anchors}. We ask when such references actually ground a relation, and identify a trap: a goal-conditioned predictor reaches a striking $0.90$ relation-readout accuracy, yet this is \emph{instruction transcription}, not perception. Withholding the goal collapses it to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

