비전-언어 모델(VLM)이 OCR 파이프라인을 대체하고 있지만, 텍스트가 불완전할 때 있는 그대로 옮기지 않고 더 그럴듯한 형태로 '고쳐 쓰는' 경향이 있다는 연구다. 깨끗한 텍스트만 쓰는 기존 OCR 벤치마크로는 잡히지 않는 문제여서, 저자들은 영어·중국어·한국어 단면 문서 1,455건에 뒤섞기, 무작위 치환, 시각적 유사 문자 치환 3종 교란을 적용한 다국어 벤치마크 FaithC4를 만들었다. 15개 시스템 평가에서 영어 기준 WER 악화 폭이 범용 VLM은 최대 4.5포인트, OCR 특화 VLM은 0.2~2포인트, 전통적 OCR은 0.6포인트 미만이었다. Qwen3-VL-4B를 층별로 분석한 결과 교란된 단어의 마지막 층 FFN 표현이 원래 인코딩과 가까울 때만 재작성이 발생했고, 4~6자 단어는 최대 10%가 고쳐진 반면 8자를 넘으면 재작성률이 0%로 떨어졌다.
- •VLM은 손상된 텍스트를 충실히 전사하지 않고 그럴듯한 형태로 재작성하는 경향을 보인다.
- •FaithC4는 영·중·한 문서 1,455건에 스크램블·무작위 치환·시각적 유사 치환을 적용한 다국어 교란 벤치마크다.
- •영어 기준 WER 악화는 범용 VLM 최대 4.5포인트, OCR 특화 VLM 0.2~2포인트, 전통 OCR 0.6포인트 미만이었다.
- •교란 단어의 마지막 층 FFN 표현이 원본 인코딩과 가까울 때만 재작성이 발동한다.
- •4~6자 단어는 최대 10% 재작성되지만 8자를 넘으면 재작성률이 0%로 떨어졌다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models
본문 미리보기
arXiv:2607.21617v1 Announce Type: new Abstract: Vision Language Models (VLMs) are increasingly used in place of traditional OCR pipelines for document understanding. In this paper, we show they do not always act as faithful transcribers: when text is imperfect, they often tend to rewrite it into a more plausible form - a behavior that clean-text OCR benchmarks cannot detect. We introduce FaithC4, a multilingual perturbation benchmark of 1,455 single-page documents (English, Chinese, Korean) wit
전체 내용이 궁금하다면?
원문을 직접 읽어보세요