허깅페이스와 엘루더AI가 공동 진행한 '파인북스' 프로젝트가 오픈소스 OCR 모델 14종을 2165페이지 분량의 고서 스캔본에 대해 벤치마크했다. 30억개 매개변수의 'dots.mocr'이 1000페이지당 1.94달러 비용으로 문자 정확도 97.6%를 기록해 1위를 차지했으며, 9억개 매개변수의 'OvisOCR2'도 96.9%로 근접한 성능을 보여 모델 크기와 정확도가 비례하지 않음을 확인했다. 연구진은 상위 모델들의 성능이 AI 학습용 데이터로는 충분하다고 평가했지만, 옛 글자체를 임의로 현대화하는 등 학술적 전사(轉寫) 용도로는 아직 부족하다고 지적했다. 팀은 생물다양성유산도서관(BHL)의 공개도서 20만권을 상위 모델로 재처리해 개방형 데이터셋으로 공개할 계획이다.
- •오픈소스 OCR 모델 14종을 고서 2165페이지로 벤치마크, 최고 정확도 97.6%(dots.mocr, 30억 파라미터)
- •9억 파라미터의 OvisOCR2가 96.9% 정확도로 2위, 모델 크기와 성능이 무관함을 입증
- •옛 OCR 텍스트로 학습한 언어모델은 사람 전사본 대비 학습 효율이 30%에 불과(Talkie 프로젝트 조사)
- •AI 학습용으로는 충분하지만 장음 s 등 고어체 임의 현대화로 학술 전사용으로는 부족
- •BHL 소장 공개도서 약 20만권을 상위 모델로 재처리해 오픈 데이터셋으로 공개 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Old OCR text cripples language model training, and FineBooks wants to fix that at scale

본문 미리보기
The FineBooks project from Hugging Face and EleutherAI tested 14 open-source OCR models on more than 2,000 historical book pages. The top model, dots.mocr, hits 97.6 percent character accuracy at under two dollars per thousand pages. That's good enough for AI training data, but not yet for scholarly transcriptions, the team says. The article Old OCR text cripples language model training, and FineBooks wants to fix that at scale appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:52AI 초안

