중국 문샷 AI가 추론·외부 지식을 배제하고 AI의 순수 시각 인지 능력만 평가하는 벤치마크 '퍼셉션벤치(PerceptionBench)'를 28일 오픈소스로 공개했다. 42개 기존 벤치마크의 오답 사례를 분석해 객체 개수 세기, 공간·깊이 이해, OCR, 환각 여부 등 10개 '원자적 시각 능력'을 도출하고, 검증을 거친 3,000개 문제로 각 능력을 독립 측정한다. GPT 계열·클로드·제미나이·키미·큐원·그록 등 16개 최신 모델을 평가한 결과 정확도 60%를 넘긴 모델이 하나도 없었고, 환각이 가장 취약한 영역으로 나타났다. 로봇·자율주행 등 물리 AI에서는 추론 이전에 정확한 '보는 능력'이 병목이라는 점에서, 멀티모달 AI 경쟁의 축을 시각 인지 기초 능력으로 옮기는 계기가 될 수 있다.
- •42개 벤치마크 오답 분석으로 시각 인지 10개 '원자적 능력' 도출, 초기 1만7,000여 문항에서 3,000개 선별
- •16개 최신 멀티모달 모델 평가에서 정확도 60% 초과 모델 전무
- •가장 취약한 항목은 환각—이미지에 없는 사물을 있다고 답하는 오류 빈발
- •같은 이미지에 유사 질문 반복 시 답이 바뀌는 일관성 문제도 확인—확률적 추정 가능성 시사
- •로봇·자율주행 등 물리 AI 시대에 '보는 능력' 독립 평가의 중요성 부각
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
문샷 AI, AI의 '보는 능력'만 측정하는 '퍼셉션벤치' 오픈소스로 공개… "추론보다 시각 인지가 더 큰 병목"
- 1.문샷 AI, 순수 시각 인지만 측정하는 벤치마크 '퍼셉션벤치' 오픈소스 공개
- 2.42개 벤치마크 오답 분석으로 개수 세기·공간 이해·OCR·환각 등 10개 원자적 시각 능력 도출
- 3.GPT·클로드·제미나이 등 16개 모델 평가에서 정확도 60%를 넘긴 모델 전무
- 4.가장 취약한 항목은 환각으로, 없는 사물을 있다고 답하는 오류 빈발
왜 중요한가?
기존 벤치마크는 시각 인지·추론·지식을 뒤섞어 오답 원인을 구분하지 못했는데, 추론을 배제하고 '보는 능력'만 측정하니 최첨단 모델도 60%를 못 넘겨 시각 인지가 진짜 병목임을 드러냈다. 로봇·자율주행 등 피지컬 AI에 직결되는 평가 기준 전환이다.
문샷 AI가 공개한 '퍼셉션벤치'는 멀티모달 AI의 핵심 병목인 시각 인지 능력을 독립적으로 평가하는 새로운 기준을 제시합니다. 국내 AI 연구자 및 개발자들은 이를 통해 차세대 멀티모달 AI의 성능 평가 방식을 재고하고, 시각 인지 기술 발전에 더욱 집중할 필요가 있습니다.
본문 미리보기
최근 멀티모달 인공지능(AI)의 성능 경쟁이 추론 능력을 넘어 '얼마나 정확하게 세상을 인식하는가'로 확장되고 있는 가운데, 중국 AI 스타트업 문샷 AI(Moonshot AI)가 AI의 순수한 시각 인지 능력을 독립적으로 평가하는 새로운 벤치마크 '퍼셉션벤치(PerceptionBench)'를 오픈소스로 28일 공개했다.이는 기존 평가 방식이 이미지 이해와 추론, 외부 지식을 함께 측정했던 것과 달리, 퍼셉션벤치는 AI가 이미지를 실제로 얼마나 정확하게 '보는지'만을 평가하도록 설계돼 차세대 멀티모달 AI의 새로운 성능 기준으로 주
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:04AI 초안

