LLM 에이전트가 장기 과제에서 근본적으로 반응적(reactive)이라는 한계를 겨냥해, 미래 상태 롤아웃과 계획 조건부 성공 추정치(텍스트판 Q-value)를 하나의 자기회귀 모델이 언어로 서술하도록 학습시켜 'what-if' 추론을 내재화하는 연구다. 단순히 룩어헤드 궤적으로 파인튜닝하면 예측적 근거 없이 선견을 흉내만 내는 '형식-능력 격차'가 생김을 확인하고, 이를 메우기 위해 3단계 학습 패러다임을 제안한다: 잠재 예측 능력을 주입하는 WM-AMT(월드모델 에이전틱 미드트레이닝), 능력을 구조화하는 FE-SFT, 시뮬레이션의 보정과 효용을 다듬는 FC-RL. 검색·수학 추론 과제에서 다른 학습 베이스라인을 일관되게 능가했으며, 근거 있고 보정된 선견에는 능력 우선(capability-first) 파이프라인이 필요함을 보였다.
- •미래 상태 롤아웃과 계획 조건부 성공 추정치(텍스트판 Q-value)를 하나의 모델이 언어로 생성하는 내재화된 월드모델 계획 제안
- •룩어헤드 굤적 단순 파인튜닝은 예측 근거 없는 표면적 모방만 낳는다는 '형식-능력 격차' 발견
- •WM-AMT(미드트레이닝) → FE-SFT(형식 구조화) → FC-RL(보정 정제)의 3단계 학습 파이프라인
- •검색·수학 추론 과제에서 다른 학습 베이스라인을 일관되게 능가
- •근거 있는 선견(foresight)에는 능력 주입을 선행하는 capability-first 파이프라인이 필수임을 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning
- 1.LLM 에이전트가 장기 과제에서 반응적인 한계를 단일 자기회귀 모델의 내재적 세계모델로 극복
- 2.미래 상태 롤아웃과 계획 조건부 성공 추정(텍스트판 Q값)을 함께 서술하도록 훈련
- 3.전망 트레이스 단순 미세조정은 예측 근거 없는 피상적 모방에 그침을 'format-capability gap'으로 진단
- 4.WM-AMT→FE-SFT→FC-RL 3단계 훈련으로 검색·수학 추론에서 다른 베이스라인 상회
왜 중요한가?
표준 에이전트가 미래 결과를 시뮬레이션할 내부 세계모델 없이 반응적으로만 행동하던 한계를, 능력 우선(capability-first) 훈련 파이프라인으로 넘어섰다. 룩어헤드 트레이스를 단순 모방하면 예측이 겉핥기에 그친다는 격차를 진단하고 근거 있고 보정된 예지를 확보한 점이 핵심이다.
본문 미리보기
arXiv:2606.27483v1 Announce Type: new Abstract: Large language model (LLM) agents have demonstrated strong capability in sequential decision-making, yet they remains fundamentally reactive in long-horizon tasks. Unlike humans who employ "what-if" reasoning to evaluate potential plans before commitment, standard agents lack an internal world model to simulate future outcomes. Therefore, we propose to internalize future-aware planning by training a single autoregressive model to verbalize both a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

