OPINE-World는 픽셀 렌더링 환경에서 상호작용만으로 객체 중심 프로그램형 월드 모델을 온라인 학습하는 LLM 에이전트다. 환경에서 행동하는 에이전트와 코드로 모델을 합성하는 에이전트가 가설-검증 루프로 협력하며, 리플레이 검증과 모델 기반 계획을 결합하고 '온톨로지 오류'라는 베이지안 객체 유형 적합도 지표로 탐색을 유도한다. 객체 어휘·목표·행동 의미가 모두 숨겨진 ARC-AGI-3 벤치마크에서 게임별 학습 없이 25개 중 20개를 풀고 인간 기준 대비 행동 효율 점수 78.4를 기록했다. 데이터 효율적이고 전이 가능한 프로그램 합성 월드 모델이 픽셀 환경으로 확장될 수 있음을 보여, 신속한 기술 습득이 필요한 적응형 에이전트 연구에 의미가 있다.
- •행동 에이전트와 코드 합성 에이전트가 가설-검증 루프로 협력하는 이중 에이전트 구조
- •베이지안 객체 유형 적합도 지표인 '온톨로지 오류'로 탐색 우선순위 결정
- •ARC-AGI-3에서 게임별 학습 없이 25개 중 20개 해결, 인간 대비 행동 효율 점수 78.4
- •딥러닝 월드 모델의 데이터 비효율성과 프로그램 합성 모델의 픽셀 환경 확장성 한계를 동시에 해결
- •객체 어휘를 유연하게 가설화해 구조화된 상태 없는 환경에서도 CEGIS류 접근 적용 가능성 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration
- 1.상호작용에서 객체 중심 프로그램형 월드모델을 온라인 학습하는 OPINE-World 제안
- 2.행동 에이전트와 코드 합성 에이전트가 가설-검증 루프로 협력
- 3.'온톨로지 오류'라는 베이지안 척도로 탐색을 유도해 객체 유형 적합성 개선
- 4.ARC-AGI-3에서 게임별 학습 없이 25개 중 20개 해결, 행동효율 78.4 달성
왜 중요한가?
심층망 월드모델은 데이터 의존적이고 전이가 약한 반면, 프로그램 합성 모델은 픽셀 환경의 객체 구조를 유연히 가정하지 못했는데, OPINE-World는 온톨로지 오류로 탐색을 조종해 사전 학습 없이 ARC-AGI-3 대부분을 풀어냈다.
언급 프로젝트
본문 미리보기
arXiv:2607.01531v1 Announce Type: new Abstract: Learning how an environment behaves from interaction is central to building agents that adapt to unfamiliar tasks. World models learned with deep networks are flexible but data-hungry and transfer poorly beyond their training distribution. Program-synthesized world models, written as source code by LLMs and refined through counterexample-guided inductive synthesis (CEGIS), are instead data-efficient and reusable, yet they have been demonstrated ma
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

