'The Unwritten Benchmark'는 잉크 흔적 없이 펜이 종이를 긁는 소리와 손동작 영상만으로 단어를 추론하는 '음향-운동학적 단어 추론' 과제를 통해 멀티모달 모델의 추상적 지각 추론 능력을 시험하는 새 벤치마크다. 인간 참가자는 3가지 필기 스타일에서 80% 이상의 순서별 글자 정확도를 보인 반면, GPT-4o와 Gemini 2.5-Pro를 포함한 최신 멀티모달 모델들은 10%조차 넘지 못했다. 특히 음성과 영상 두 모달리티를 함께 제공하면 오히려 성능이 떨어지는 역설적 융합 효과가 발견됐는데, 이는 모델이 상호 보완적 지각 단서를 통합하는 데 근본적 한계가 있음을 보여준다. 이는 정적 인식을 넘어선 동적·생성적 추론에서 현재 멀티모달 AI의 취약점을 드러낸다.
- •잉크 없이 펜 소리·손동작만으로 단어를 추론하는 새 벤치마크 제안
- •인간은 80% 이상 정확도, GPT-4o·Gemini 2.5-Pro는 10% 미만에 그침
- •두 모달리티를 함께 주면 오히려 성능이 떨어지는 '역설적 융합 효과' 발견
- •모델의 교차 모달 인과 추론과 미세 운동학 이해에 근본적 한계 확인
- •정적 인식을 넘어선 동적·생성적 지각 추론 평가의 새 지평 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning
- 1.펜 긁힘 소리와 손동작 영상만으로 글자를 유추하는 'Unwritten Benchmark' 신규 제시
- 2.인간은 순서정확도 80% 이상 달성, GPT-4o·Gemini 2.5-Pro는 10%도 못 넘어
- 3.두 모달리티(음성+영상) 동시 제공 시 오히려 성능이 떨어지는 '역설적 융합' 현상 발견
왜 중요한가?
잉크 흔적 없이 추상적 단서만으로 정보를 추론하는 능력에서 최상위 멀티모달 모델이 인간에 크게 못 미친다는 점을 드러내, 교차모달 인과추론의 근본적 한계를 조명한다.
언급 프로젝트
본문 미리보기
arXiv:2608.14558v1 Announce Type: new Abstract: Current multimodal models have demonstrated remarkable proficiency in recognizing static visual and auditory content. However, their capacity for abstract perceptual reasoning, inferring unseen information from dynamic, generative processes, remains a critical and underexplored frontier. In this paper, we introduce The Unwritten Benchmark, a new challenge designed to probe this abstract perceptual and cognitive ability. We define the core task as
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
