이 논문은 멀티모달 대형언어모델(MLLM)이 문서형 이미지 안에서 텍스트 맥락을 활용해 차트 증거를 선택·해석·집계할 수 있는지를 평가하는 벤치마크 DocHop을 소개한다. 기존 벤치마크는 차트 이해와 문서 이해를 분리해 평가해온 반면, DocHop은 문서 서사가 다단계 구성적 제약을 지정하고 차트가 그에 대응하는 데이터 값을 제공하는 구조로, 모델이 먼저 맥락에서 대상 개체를 특정한 뒤 여러 차트에 걸쳐 증거를 종합하도록 요구한다. 확률적 논리 우선 생성 파이프라인으로 추론 난도와 시각적 밀도를 조절하며 6개 과제 유형에 걸쳐 2,074개 예제를 구축했다. 실험 결과 사람 평가자는 90% 이상의 정확도를 보인 반면 최고 성능 모델은 62.83%에 그쳐 상당한 격차가 확인됐으며, 추론 강화 모델일수록 성능이 개선되지만 추론 복잡도가 높아질수록 성능이 저하됐다.
- •DocHop은 문서형 이미지에서 텍스트 맥락과 차트 증거를 통합 추론하는 능력을 평가하는 벤치마크다.
- •모델이 맥락에서 대상 개체를 먼저 특정한 뒤 여러 차트의 증거를 종합하도록 요구한다.
- •확률적 논리 우선 파이프라인으로 6개 과제, 2,074개 예제를 생성했다.
- •사람 정확도는 90% 이상인 반면 최고 성능 모델은 62.83%에 그쳐 큰 격차를 보였다.
- •추론 강화 모델이 더 좋은 성능을 보이지만 추론 복잡도가 커질수록 성능이 저하된다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents
- 1.DocHop: 차트-문맥 통합 추론 평가 벤치마크 공개, 6개 태스크·2,074개 예제로 구성
- 2.문서 서사가 지정한 다단계 제약을 만족하려면 여러 차트에서 근거를 조합해야 함
- 3.인간 주석자는 90% 이상 정확도, 최고 성능 모델은 62.83%에 그쳐 큰 격차 확인
- 4.추론 강화 모델일수록 성능이 높지만 추론 복잡도가 커지면 성능이 저하되는 경향
왜 중요한가?
차트와 텍스트를 동시에 이해해야 하는 실제 업무형 문서 QA에서 MLLM의 한계를 정량적으로 드러내, 멀티모달 에이전트의 신뢰도 평가 기준을 세분화하는 데 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2609.02059v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) have achieved strong performance on structured visual understanding tasks such as chart and document question answering. However, existing benchmarks typically evaluate these domains in isolation, leaving underexplored a key capability: whether models can use textual context to determine how chart evidence should be selected, interpreted, and aggregated. We introduce DocHop, a benchmark for integrated chart
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
