AGI Maze는 LLM 에이전트가 외부 세계의 지속적·조작 가능한 표현(월드 모델)을 실제로 형성하는지 시험하는 경량 벤치마크 프레임워크다. 고차원 감각 입력 없이 부분 관측·상태 유지·은닉 상태 가설이 필요한 격자 미로 과제군을 깔끔한 API와 여러 난이도로 제공한다. 초기 평가에서 바닐라 LLM들은 추론 시점에 미로를 내부적으로 표현하지 못해 실패했고, 메시지 히스토리를 작업 기억으로 쓰는 베이스라인 에이전트도 성능은 개선되지만 인간에게 충분한 스텝 예산 내에서 작은 미로조차 안정적으로 풀지 못했다. 텍스트에서 '추론'처럼 보이는 능력이 상태 있는 환경에서는 크게 약해진다는 점을 드러내, 다음 토큰 예측과 진짜 월드 모델링 사이의 간극을 측정하는 도구를 제공한다.
- •고차원 센서 입력 없이 부분 관측·상태 유지 환경을 만드는 경량 그리드 미로 벤치마크 프레임워크
- •관찰에서 규칙만 추론하는 게 아니라 월드 상태 표현을 학습·활용해야 하는 과제 설계
- •바닐라 LLM들은 추론 시점에 미로를 내부 표현하지 못해 실패
- •메시지 히스토리를 작업 기억으로 쓰는 베이스라인도 작은 미로를 인간 수준 스텝 예산 내 안정적으로 해결 못함
- •텍스트 추론과 상태 있는 환경의 월드 모델링 사이 간극을 측정하는 도구 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AGI Maze as a Benchmark Framework for World-Modeling Agents
- 1.부분 관측·상태 기반 미로에서 에이전트의 세계 모델링 능력을 평가하는 벤치마크 AGI Maze 공개
- 2.격자 미로 과제와 다중 난이도, 깔끔한 API로 경량 환경 구축 지원
- 3.바닐라 LLM들은 추론 시점에 미로를 내부 표현하지 못해 실패함을 확인
- 4.메시지 히스토리를 작업 메모리로 쓰는 베이스라인도 작은 미로조차 안정 해결 실패
왜 중요한가?
텍스트 추론처럼 보이는 과제도 상태·메모리가 필요해지면 LLM이 취약함을 드러내, 지속적이고 조작 가능한 세계 상태 표현을 학습·활용하는 벤치마크 연구의 필요성을 정량적으로 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2607.00627v1 Announce Type: new Abstract: Large language models (LLMs) are powerful pattern-completion systems, but their default operating mode - predicting the next token from a static context - does not reliably produce persistent, manipulable representations of an external world. Many tasks that look like "reasoning" in text become substantially harder once the environment is partially observable, stateful, and requires memory and structured hypotheses about hidden state. AGI Maze is
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

