Infinity-Parser2는 제어 가능한 데이터 합성 파이프라인과 다중작업 강화학습을 결합한 대형 멀티모달 문서 파싱 모델이다. 렌더링 프레임워크와 반복 정제 루프로 500만 샘플 규모의 중·영 이중언어 코퍼스 Infinity-Doc2-5M을 구축·공개했으며, 문서 파싱·레이아웃·표·수식·차트·화학식·문서 VQA 등 8개 목표를 공동 학습하는 검증형 다중작업 보상 체계를 도입했다. Pro 버전은 olmOCR-Bench 87.6%, ParseBench 74.3%로 DeepSeek-OCR-2, PaddleOCR-VL-1.5, MinerU2.5를 넘어 SOTA를 달성했고, Flash 버전은 기존 대비 3.68배 처리량을 낸다. 신뢰할 만한 파싱 주석 데이터 부족 문제를 합성 데이터로 해소하는 실용적 접근이다.
- •500만 샘플 규모의 중·영 이중언어 문서 코퍼스 Infinity-Doc2-5M을 구축·오픈소스로 공개
- •문서 파싱·레이아웃·표·수식·차트·화학식·VQA 등 8개 목표를 공동 학습하는 검증형 다중작업 보상 체계 도입
- •Pro 버전이 olmOCR-Bench 87.6%, ParseBench 74.3%로 SOTA 달성, DeepSeek-OCR-2·PaddleOCR-VL-1.5·MinerU2.5 상회
- •Flash 버전은 Infinity-Parser-7B 대비 3.68배 처리량으로 저지연 추론에 최적화
- •제어 가능한 합성 엔진으로 정확한 주석 코퍼스 부족 문제를 해결
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Infinity-Parser2 Technical Report
- 1.문서 파싱 멀티모달 모델 Infinity-Parser2 공개, Pro가 olmOCR-Bench 87.6%로 SOTA
- 2.제어 가능한 합성 엔진으로 500만 샘플 중·영 코퍼스 Infinity-Doc2-5M 구축·오픈소스화
- 3.표·수식·차트·화학식 파싱 등 8개 과제를 검증 가능한 보상으로 공동 강화학습
- 4.저지연 Flash 버전은 Infinity-Parser-7B 대비 3.68배 처리량
왜 중요한가?
문서 파싱의 고질적 학습 데이터 부족을 합성 파이프라인으로 해결하고 DeepSeek-OCR-2·MinerU2.5를 능가한 점에서, OCR·문서 AI 파이프라인을 구축하는 팀에 직접적 대안이 된다.
본문 미리보기
arXiv:2607.07836v1 Announce Type: new Abstract: We present Infinity-Parser2, a large multimodal model that couples a controllable data-synthesis pipeline with multi-task reinforcement learning for end-to-end document parsing, addressing the persistent scarcity of faithfully annotated parsing corpora. Our contributions are threefold. First, we build a scalable synthesis engine, pairing a controllable rendering framework with an iterative refinement loop, and use it to construct and open-source I
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

