컴퓨터과학 논문의 아키텍처 다이어그램, 시스템 흐름도, 파이프라인 도식은 종종 주변 텍스트보다 많은 정보를 담고 있지만, 이를 캡션·맥락·질의응답·단계별 추론과 짝지은 공개 데이터셋은 없었다. 연구진은 arXiv 컴퓨터과학 논문에서 레이아웃 검출과 PDF 파싱, AI 보조 질문 생성을 거쳐 만든 대규모 구조화 데이터셋 SCAFFOLD를 공개했다. 3,058편의 논문에서 뽑은 29,887개 그림으로 구성된 157,387쌍 규모의 SCAFFOLD-157K와 함께 37K, 12K 규모의 소형 버전도 함께 제공한다. 연구진은 SCAFFOLD-12K를 이용해 Qwen2.5-VL-3B-Instruct에 대한 기준선 실험을 수행했다.
- •다이어그램-캐벅션-맥락-QA-CoT 추론을 연결한 공개 데이터셋 SCAFFOLD 발표
- •arXiv 컴퓨터과학 논문 3,058편에서 29,887개 그림, 157,387쌍 추출
- •레이아웃 검출·PDF 파싱·AI 보조 질문 생성으로 구축
- •SCAFFOLD-12K로 Qwen2.5-VL-3B-Instruct 기준선 실험 수행
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
- 1.SCAFFOLD는 CS 논문 도표에 캡션·맥락·QA·사고연쇄(CoT)까지 짝지은 첫 대규모 공개 데이터셋
- 2.arXiv CS 논문 3,058편의 도표 29,887개로 총 15만7,387쌍을 구축, 중소형 버전도 공개
- 3.레이아웃 검출·PDF 파싱과 AI 보조 질문생성 파이프라인으로 제작
- 4.SCAFFOLD-12K로 Qwen2.5-VL-3B-Instruct 기준 베이스라인 실험을 수행
왜 중요한가?
논문 속 도표는 텍스트보다 많은 정보를 담고 있는데도 이를 이해하는 비전언어모델 학습용 데이터가 없었다는 공백을 메워, 학술 도표 이해 VLM 연구의 표준 벤치마크로 쓰일 가능성이 크다.
본문 미리보기
arXiv:2609.00018v1 Announce Type: new Abstract: Computer science papers rely heavily on diagrams: architecture drawings, system flowcharts, and pipeline schematics that often carry more information than the text around them. There is currently no public dataset that pairs this specific kind of figure with captions, context, questions, answers, and step-by-step reasoning, which is exactly what is needed to train a vision-language model to understand them. We present \textbf{SCAFFOLD}\footnote{ht
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
