문샷AI가 멀티모달 AI 모델의 시각 인지 능력만을 논리적 추론과 분리해 평가하는 벤치마크 'PerceptionBench'를 공개했다. 시각 관계·개수 세기·속성·깊이·위치 등 10개 세부 능력으로 나눈 3000개 문제로 구성됐으며, 42개 기존 벤치마크의 실제 오류 사례를 바탕으로 설계됐다. GPT-5.6 솔이 59.7%로 1위를 차지했지만 16개 프론티어 모델 중 어느 것도 60%를 넘지 못했고, 특히 '환각'(존재하지 않는 객체를 만들어내는 오류) 영역이 전반적으로 가장 취약했다. 연구진은 추론 오류로 분류돼온 실패의 상당수가 실제로는 이미지 인지 단계에서부터 이미 잘못됐다고 지적했다.
- •문삷AI, 시각 인지만 따로 평가하는 벤치마크 PerceptionBench 공개, 10개 세부 능력 분류
- •GPT-5.6 솔 59.7%로 1위, 그러나 16개 프론티어 모델 모두 60% 미만
- •Kimi K3 58.5%, Claude Fable 5 57.2%, Gemini 3.1 Pro 56.2% 순
- •'환각' 하위 영역이 전반적으로 가장 취약, GPT-5.6 솔도 26.9%에 그침
- •다수의 '추론 오류'가 실제로는 이미지 인지 단계의 실패에서 기인한다고 결론
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
New benchmark confirms AI models still perform poorly at visual perception

- 1.문샷AI, 시각 지각만 따로 측정하는 벤치마크 'PerceptionBench' 공개, 10개 세부스킬로 오류 분류
- 2.16개 모델 중 최고 정확도는 GPT-5.6 Sol 59.7%, 60% 넘는 모델 없음
- 3.'환각' 항목이 가장 취약, GPT-5.6 Sol은 종합 1위임에도 이 항목에서 26.9%에 그쳐
왜 중요한가?
많은 '추론 오류'가 사실은 이미지 판독 단계에서 발생한 지각 실패라는 점을 실증해, 멀티모달 모델의 취약점 개선 방향을 추론이 아닌 시각 처리 자체로 좁혀준다.
본문 미리보기
Moonshot AI's PerceptionBench tests how well multimodal AI models can actually "see," separate from logical reasoning. No frontier model reaches 60 percent accuracy, and GPT-5.6 Sol leads by a narrow margin. Many supposed reasoning errors actually happen as early as the image-reading stage. The article New benchmark confirms AI models still perform poorly at visual perception appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:17AI 초안

