포인트앤클릭 퍼즐 게임에서 VLM의 인간과 유사한 논리적 문제 해결 능력을 평가하기 위한 VLATIM 벤치마크를 소개합니다. 기본 시각적 기반부터 다단계 조작 및 전체 퍼즐 해결까지 5단계로 구성되며, 고수준 논리 추론과 정밀한 연속 행동 공간 사이의 격차를 집중 평가합니다. 대규모 독점 모델들이 계획 능력은 우수하지만 정확한 시각적 기반 파악에 어려움을 겪어 인간 수준의 문제 해결 능력에 아직 미치지 못함을 밝혔습니다.
- •VLATIM은 클래식 물리 퍼즐 게임 TIM2를 기반으로 한 VLM 논리 문제 해결 능력 평가 벤치마크입니다.
- •기본 시각적 기반부터 다단계 조작 및 전체 퍼즐 해결까지 5단계로 구성됩니다.
- •대규모 독점 모델은 계획 능력은 우수하지만 정밀한 시각적 기반 파악에 어려움을 격습니다.
- •현재 VLM은 인간과 유사한 문제 해결 능력을 아직 보여주지 못합니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?
- 1.클래식 물리 퍼즘 게임으로 VLM의 인간 수준 논리적 문제 해결 능력을 평가하는 VLATIM 벤치마크 소개
- 2.고수준 논리적 추론과 정밀한 시각적 기초 실행 간 큰 격쉠 확인
- 3.대형 독점 모델도 정밀한 시각적 기초에서 여전히 어려움을 격음
- 4.5단계 점진적 평가로 시각 기초부터 완전한 퍼즘 해결까지 역량 측정
왜 중요한가?
VLM이 고수준 추론은 가능하지만 정밀한 물리적 상호작용이 필요한 실행에서는 인간 수준에 미치지 못함을 구체적으로 보여주어, VLM의 실제 배포 한계를 명확히 한다.
언급 프로젝트
본문 미리보기
arXiv:2605.11223v1 Announce Type: new Abstract: Vision-Language(-Action) Models (VLMs) are increasingly applied to interactive environments, yet existing benchmarks often overlook the complex physical reasoning required for point-and-click puzzle games. This paper introduces Vision-Language Against The Incredible Machine (VLATIM), a benchmark designed to evaluate human-like logical problem-solving capabilities within the classic physics puzzle game The Incredible Machine 2 (TIM). Unlike existin
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

