연구진은 시각언어모델이 이미지 속 비정상적인 텍스트를 언어적으로 타당한 표현으로 바꿔 써버려 OCR 전사 충실도를 해치는 문제를 해결하기 위해 GAD-RL을 제안했다. 고정된 교사 모델의 지도가 학생 모델이 개선될수록 점점 덜 유효해진다는 오프라인 분석 결과에 따라, GAD-RL은 학생의 현재 과제 성능과 지역적 분포에 맞춰 교사의 지도를 적응적으로 조절한다. 과제 보상이 0.95 이상인 응답군에는 증류를 비활성화하고, 그룹 평균 보상이 높아질수록 증류 강도를 지속적으로 약화시키며, 학생의 교사 1위 토큰에 대한 확률로 순방향 KL에 가중치를 매겨 지지도가 낮을 때는 국소 보조 업데이트를 완화한다. Qwen3.5-2B에서 GAD-RL은 CHAOS-Bench 마이크로 재현율 59.92%를 달성해 GRPO와 GRPO+OPD(고정 가중치) 대비 각각 8.45%p, 4.43%p 앞섰고, OmniDocBench v1.6에서 종합 점수 91.18을 기록했다.
- •시각언어모뎌이 이미지 속 보상 톍스트를 '그럴뙤해처' 표현으로 바꿠어 OCR 충실도를 틈랭하는 뮸제점 지적
- •GAD-RL, 학생 모뎌의 현재 성과에 따라 고정 교사의 지도 강뇌론 적응적으로 조절
- •과제 뿔상 0.95 이상 응답에는 증뇌랑을 뿔화해 가댌한 지도 방지
- •Qwen3.5-2B에서 CHAOS-Bench 마이놥름 뿔현율 59.92%, GRPO 대뿔 8.45%p 향상
- •OmniDocBench v1.6 종합 점수 91.18 뙼성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
- 1.GAD-RL, 학생 모델 성능에 따라 교사 증류 강도를 적응적으로 조절하는 OCR 충실도 개선법 제안
- 2.과제보상 0.95 이상 응답군은 증류 비활성화, 보상 상승할수록 증류 강도 점진 감쇠
- 3.학생의 교사 Top-1 토큰 지지도로 KL 가중치 조절해 국소 보조 업데이트 조정
- 4.Qwen3.5-2B서 CHAOS-Bench 59.92% 마이크로 재현율, GRPO 대비 8.45%p 우위
왜 중요한가?
시각언어모델이 이미지 속 이례적 텍스트를 그럴듯하게 고쳐 써 OCR 정확성을 해치는 문제를, 고정 교사의 지도가 학생 성장에 따라 비효율적이 된다는 관찰에 기반해 동적으로 해결한다.
언급 프로젝트
본문 미리보기
arXiv:2609.38282v1 Announce Type: new Abstract: Vision-language models may rewrite anomalous text in images into linguistically plausible expressions, compromising OCR transcription faithfulness. Sequence-level task rewards and local teacher guidance are complementary, but guidance from the same teacher may not remain equally effective as the student improves. Offline analysis shows that supervision from a fixed teacher becomes progressively less favorable as the student improves, both across t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

