세계모델은 모델기반 강화학습의 핵심 요소로, 보통 관측·보상·상태·잠재상태 등 무엇을 예측하는지로 논의된다. 이 논문은 그보다 앞선 구분으로 '어떤 채널을 모델링하는가'가 있다고 주장하며, 환경 채널, 에이전트 채널, 실현된 결합 과정 세 가지를 구분한다. 계산역학을 활용해 이 세 경우에 대한 정준 예측 모델을 ε-변환기(ε-machine)로 정의하며, 정준 환경모델은 표준 예측상태표현을 복원하고 나머지 둘은 에이전트와 결합시스템에 대응하는 정준모델 개념을 새로 제공한다. 이어 폐루프 결합에 의해 유도되는 정준 지지집합제한 환경·에이전트 모델을 구성하는데, 핵심 결과는 정준 지지집합제한 환경상태가 정준 결합 인과상태를 통해 분해되며 그 전이구조가 결합모델에서 직접 유도된다는 것이다. 마지막으로 무제한 환경모델은 무한한 상태를 갖지만 결합에 의해 유도된 정준 지지집합제한 모델은 유한한 POMDP/제어기 예시를 제시해, 결합과 지지집합 제한이 세계모델의 정준 예측 구조와 복잡도를 어떻게 바꾸는지 규명한다.
- •세계모델 구분의 선행 기준으로 '어떤 채널을 모델링하는가'(환경/에이전트/결합과정) 제안
- •계산역학의 ε-변환기(ε-machine)로 세 채널 각각의 정준 예측모델 정의
- •정준 환경모델은 표준 예측상태표현(PSR)을 복원, 에이전트·결합모델은 대응 개념을 새로 제공
- •폐루프 결합으로 유도되는 지지집합제한 모델을 구성, 환경상태가 결합 인과상태를 통해 분해됨을 증명
- •무제한 환경모델은 무한 상태이나 결합 유도 지지집합제한 모델은 유한함을 POMDP 예시로 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
World models of environment, agent and joint agent-environment systems
- 1.세계모델을 '무엇을 예측하는가' 대신 '어떤 채널을 모델링하는가' 기준으로 재분류하는 틀 제안
- 2.환경 채널, 에이전트 채널, 결합된 실현 과정 세 경우를 계산역학의 엱실론머신으로 정의
- 3.폐루프 결합으로 유도된 지지영역 제한 모델이 결합 인과상태로 구조화됨을 핵심 결과로 제시
- 4.POMDP 예시서 무제한 환경모델은 무한 상태, 결합으로 제한된 모델은 유한함을 증명
왜 중요한가?
모델기반 강화학습의 핵심 요소인 세계모델을 수학적으로 엄밀히 재정의해, 서로 다른 세계모델 접근법들이 실제 무엇을 모델링하는지 비교할 공통 기준을 제공한다.
본문 미리보기
arXiv:2608.20401v1 Announce Type: new Abstract: World models are a central component of model-based reinforcement learning. They are usually discussed in terms of what variables they predict, such as observations, rewards, states, latent or information states. We argue that there is a prior distinction: which channel they model. We consider three cases: the environment channel $O_{:} \mid A_{:}$, the agent channel $A_{:} \mid O_{:}$, and the realised joint process $(A, O)_{:}$, equivalently vie
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
