멀티모달 GraphRAG에서 그래프에 연결된 이미지 후보 랭킹을 단일 벡터 바이인코더 대신 ColBERT/ColPali 계열의 late-interaction MaxSim 멀티벡터 스코어링으로 교체한 ColGraphRAG 연구다. 단일 벡터 유사도는 세밀한 정렬에 필요한 패치·토큰 수준 구조를 잃는다는 문제의식에서 출발해, 그래프 구축·텍스트/테이블 검색·구조화 추출·추론 단계는 그대로 두고 시각 후보 랭킹 연산자만 바꿨다. MultimodalQA에서 그래프 연결 이미지 후보의 검색 단계 지표와 다운스트림 QA가 개선됐고, 시각 증거가 중요한 질문일수록 개선 폭이 컸으며 텍스트 위주 질문에서는 혼재된 경향을 보였다. 이미지 증거가 추론 단계에 진입하는 병목을 late-interaction으로 푸는 메커니즘 수준의 근거를 제시했다는 의미가 있다.
- •그래프 연결 이미지 노드 랭킹을 ColBERT/ColPali 계열 late-interaction MaxSim 멀티벡터 스코어링으로 교체
- •단일 벡터 바이인코더가 잃는 패치·토큰 수준 구조를 보존해 세밀한 시각 정렬 가능
- •그래프 구축·텍스트/테이블 검색·추론 단계는 변경 없이 랭킹 연산자만 교체한 통제된 실험 설계
- •MultimodalQA에서 시각 증거가 중요한 질문일수록 검색·QA 개선 폭이 크고, 텍스트 위주 질문은 혼재된 경향
ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG
- 1.멀티모달 GraphRAG의 이미지 후보 랭킹을 ColBERT/ColPali 계열 late-interaction 다중 벡터 점수로 교체
- 2.단일 벡터 유사도가 버리는 패치·토큰 수준 구조를 MaxSim 방식으로 보존, 그래프 구축 등은 그대로 유지
- 3.MultimodalQA에서 이미지 증거 중요 문항 중심으로 검색·QA 성능 개선, 텍스트 중심 문항은 혼재
왜 중요한가?
GraphRAG의 최종 정확도가 어떤 시각 자산이 추론 단계에 진입하느냐에 좌우된다는 점을 짚고, 랭킹 연산자 하나만 바꿔도 이미지 증거 활용도가 개선됨을 보였다. 텍스트·표·이미지 혼합 문서 QA 파이프라인의 저비용 개선 포인트다.
본문 미리보기
arXiv:2607.16208v1 Announce Type: new Abstract: Graph-grounded multimodal question answering organizes text, tables, and images in a structured evidence graph, yet end-to-end accuracy depends on which multimodal assets are ranked highly enough to enter downstream reasoning; for graph-linked images, single-vector bi-encoder similarity can discard patch- and token-level structure needed for fine-grained alignment. We evaluate replacing the visual candidate-ranking operator over graph-linked image
전체 내용이 궁금하다면?
원문을 직접 읽어보세요