MLLM이 개별 시각 요소 인식과 단순 선형 다이어그램 추론에는 뛰어나지만 분기·수렴·순환을 포함한 복잡 토폴로지 구조에서는 추론 능력이 급락한다. ReactBench는 화학 반응 다이어그램으로 이 구조적 추론 한계를 드러내는 벤치마크. 1,618개 전문가 주석 QA 쌍, 4개 계층 태스크 차원으로 구성. 17개 MLLM 평가에서 앵커 기반 태스크와 전체적 구조 추론 간 30%+ 성능 격차 확인. 통제 어블레이션으로 병목이 인식이 아닌 추론에 있음을 입증.
- •MLLM의 복잡 토폴로지 구조 추론 능력 평가 ReactBench
- •화학 반응 다이어그램 1,618 전문가 주석 QA
- •17 MLLM 평가: 앵커 vs 전체 구조 추론 30%+ 격차
- •병목은 시각 인식이 아닌 구조적 추론에 있음 입증
- •4개 계층 태스크 차원으로 세분화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
- 1.MLLM의 구조적 추론 한계 정량 평가 벤치마크
- 2.시각 인식 성능 vs 구조 추론 성능의 30%+ 격차
- 3.화학 같은 과학 도메인 AI 응용의 근본 장벽
왜 중요한가?
MLLM이 과학·공학 다이어그램 이해에 투입될 때 구조적 추론이 핵심. ReactBench는 이 능력을 정량화해 다음 세대 MLLM 개선 목표를 제시.
언급 프로젝트
본문 미리보기
arXiv:2604.15994v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) excel at recognizing individual visual elements and reasoning over simple linear diagrams. However, when faced with complex topological structures involving branching paths, converging flows, and cyclic dependencies, their reasoning capabilities degrade sharply, even on tasks as basic as counting endpoints. Existing benchmarks fail to probe this gap, focusing on semantic comprehension rather than structural
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:32AI 초안

