문서 AI를 프로덕션 규모로 운영하기 위한 마이크로서비스 아키텍처를 제안한다. 분류, OCR, LLM 구조화 필드 추출을 포함한 다중 모델 파이프라인을 마이크로서비스로 캡슐화하고, GPU 바운드 추론과 CPU 바운드 오케스트레이션을 분리하며 비동기 처리를 통해 IO 지연을 최소화한다. 배치 프로파일링을 통해 엔드투엔드 지연의 주요 원인이 LLM이 아닌 OCR임을, 처리량 포화가 워커 수가 아닌 공유 GPU 추론 용량에 의해 결정됨을 발견했다.
- •분류·OCR·LLM 필드 추출을 마이크로서비스로 캐프슐화한 프로덕션용 문서 AI 아키텍처 제안
- •GPU 바운드 추론과 CPU 바운드 오케스트레이션을 분리하고 비동기 처리로 IO 지연 최소화
- •엔드투엔드 지연의 주요 원인이 LLM 파싱이 아닌 OCR 단계임을 배치 프로파일링으로 확인
- •시스템 포화 지점은 워커 수가 아닌 공유 GPU 추론 용량에 의해 결정됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production
- 1.문서 AI를 프로덤션 규모로 운영하는 OCR·LLM 파이프라인 마이크로서비스 아키텍처 제시
- 2.GPU 추론과 CPU 오케스트레이션 분리, 비동기 처리로 시간당 수청 다페이지 문서 처리
- 3.OCR이 LLM 파싱보다 지연시간을 지배한다는 예상 외 발견은 프로덤션 설계 필수 고려사항
왜 중요한가?
학술 모델 연구와 프로덕션 배포 사이의 간극을 메우는 구체적 아키텍처 패턴을 제공해 문서 AI를 실제 비즈니스에 도입하려는 팀에게 실질적 지침을 제공한다.
본문 미리보기
arXiv:2605.18818v1 Announce Type: new Abstract: Academic research tends to focus on new models for document understanding creating a wide gap in the literature between model definition and running models at production scale. To close that gap, we present a microservice architecture that encapsulates pipelines of multiple models for classification, optical character recognition (OCR), and large language model structured field extraction as well as our experience running this pipeline on thousand
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

