연구진은 다중모달 대형언어모델(MLLM)의 창의적 이해 능력을 평가하기 위해 중국어 성어(청위) 기반 '교차개념 이해' 벤치마크 'C4'를 제안했다. 명확한 목표와 보상 신호가 부족한 창의성 평가의 어려움을 해결하고자, 항목 구성을 교차개념 인코딩으로, 모델 추론을 교차개념 디코딩으로 정의하고 수작업 주석·검증된 개념 네트워크에서 이미지화 가능한 대체 개념으로 연결하는 방식을 사용했다. 이를 바탕으로 합성 항목 184개와 실제 수집된 교차개념 성어 그림 37개로 구성된 평가셋 'C4-Eval'을 구축해 5가지 과제 설정으로 총 884개 정답 복원 사례를 만들었다. 10개 MLLM을 평가한 결과 가장 강력한 폐쇄형 모델도 정확도 50.7%와 48.0%에 그쳤고 오픈소스 모델은 훨씬 낮아, 현재 MLLM이 교차개념 관계를 통해 창의적으로 인코딩된 의미를 해독하는 데 상당한 격차가 있음을 드러냈다.
- •연구진은 중국어 성어 기반 교차개념 이해 벤치마크 'C4'를 제안했다.
- •합성 항목 184개와 실제 수집 항목 37개로 평가셋 'C4-Eval'을 구축했다.
- •5가지 과제 설정으로 총 884개 정답 복원 사례가 만들어졌다.
- •가장 강력한 폐쇄형 MLLM도 정확도 50.7%·48.0%에 그쳤다.
- •오픈소스 모델은 정확도가 훨씬 낮아 창의적 의미 해독에 큰 격차가 확인됐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding
본문 미리보기
arXiv:2608.06501v1 Announce Type: new Abstract: Creative capabilities of MLLMs matter in design, communication, education, and human--AI collaboration, yet remain difficult to evaluate because explicit targets and reward signals are scarce compared with accuracy-oriented tasks. Cross-concept understanding is a core cognitive capacity underlying receptive creativity. It enables a perceiver to recover intended meaning from non-obvious but meaningful conceptual relations. We operationalize item co
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

