비전-언어 모델(VLM)이 단일 이미지에서 잠재 공간 구조를 재구성하는 능력을 순수하게 측정하기 위한 벤치마크 StateSight를 제안한 연구다. 큐브넷 반대면 추론, 가려진 큐브탑 개수 세기, 4방향 연결요소 개수 세기 등 3개 과제군에 각각 300개의 단일 이미지 프롬프트와 결정론적 정답, 정확 일치 채점을 적용했다. GPT-5.5는 세 과제에서 각각 59.3%, 33.3%, 28.3%, Claude Sonnet 5는 53.3%, 18.7%, 7.3%의 정확도를 기록했으며, 30명의 사람 기준선은 80.8%, 68.8%, 64.3%로 모든 과제에서 두 모델을 앞질렀다. 형식이 맞는 응답이 실제로는 공간 구조 복원 실패를 가리는 경우가 많다는 점을 보여준다.
- •지각·OCR·추론이 뚤섞인 기존 벤치마크와 달리 순수 공간구조 재구성 능력만 측정하는 StateSight 제안
- •큐브넷 반대면 추론, 가려진 큐브탑 세기, 4방향 연결요소 세기 등 3개 과제, 각 300개 프롬프트
- •GPT-5.5 정확도 59.3%/33.3%/28.3%, Claude Sonnet 5는 53.3%/18.7%/7.3%
- •30명 사람 기준선(80.8%/68.8%/64.3%)이 모든 과제에서 두 모델을 크게 앞서
- •형식상 완벽한 응답도 실제 공간 추론 실패를 감출 수 있음을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models
- 1.큐브넷 반대면 추론·가려진 큐브탑 세기·연결요소 세기 3과제로 구성된 벤치마크 StateSight 공개
- 2.GPT-5.5는 세 과제에서 59.3%·33.3%·28.3%, Claude Sonnet 5는 53.3%·18.7%·7.3% 정확도
- 3.30명 인간 기준선은 세 과제 모두 앞서 평균 80.8%·68.8%·64.3% 기록
- 4.형식 오류는 0건이지만 응답 형식이 맞아도 공간구조 복원엔 실패하는 경우 다수 확인
왜 중요한가?
형식적으로 정답처럼 보이는 응답도 실제로는 이미지의 공간 구조를 제대로 복원 못한 채 나온다는 점을 정량화해, 비전-언어 모델의 공간추론을 형식 정확도만으로 평가하면 안 됨을 보여준다.
본문 미리보기
arXiv:2608.20414v1 Announce Type: new Abstract: Vision-language models are increasingly used for multimodal question answering, yet their ability to reconstruct latent spatial structure from a single image remains difficult to isolate. Broad benchmarks often combine perception, optical character recognition, domain knowledge, linguistic priors, and reasoning in the same evaluation. We introduce StateSight, a procedurally generated benchmark for cube-net opposite-face reasoning, occluded cube-to
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
