DharmaOCR 팀이 주로 챗봇 정렬에 쓰이던 DPO(직접 선호 최적화)를 OCR의 '텍스트 퇴화'(반복 루프) 실패를 직접 억제하는 도구로 적용했다. SFT 이후 모델 자신이 만들어낸 퇴화 출력을 걸러내지 않고 오히려 '거부' 예시로 삼아 선호 쌍을 구성했고, 2만3726개 문서에서 후보 출력을 LLM 심사로 채점했다. 그 결과 테스트한 5개 모델 패밀리 모두에서 SFT 대비 퇴화율이 평균 59.4%, 최대 87.6%(Nanonets-OCR2-3B 1.61%→0.20%) 감소했다. SFT는 토큰 단위 우도 최대화라 반복 루프를 완성 수준 실패로 벌하지 못하지만, 완성 전체를 신호로 쓰는 DPO는 구조적으로 다른 실패 차원을 다룬다는 점을 보여준다.
- •도메인 특화 OCR 모델 DharmaOCR이 SFT 다음 단계로 DPO를 적용해 텍스트 퇴화 완화
- •핵심 설계: 모델 자신의 퇴화(반복 루프) 출력을 거부 예시로 보존—노이즈가 아닌 음성 신호로 활용
- •5개 모델 패밀리 모두에서 SFT 대비 퇴화율 평균 59.4%, 최대 87.6% 감소(방향 일관)
- •gemma-3-4b-it는 최고 33.96% 퇴화율에서도 DPO 후 75% 감소
- •SFT는 과제 적응과 동시에 실패 기하학에 근접시키며(Qwen2.5-VL-3B 0.60%→3.23%), DPO가 이를 1.41%로 교정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Direct Preference Optimization Beyond Chatbots
- 1.DharmaOCR, DPO를 챗봇 정렬이 아닌 OCR 텍스트 degeneration 억제에 적용
- 2.모델 자신의 반복 루프 실패 출력을 거부 샘플로 삼아 선호쌍 구성
- 3.SFT 대비 5개 모델 패밀리 모두에서 degeneration 평균 59.4%·최대 87.6% 감소
- 4.23,726개 문서로 학습, LLM 심판이 자동 채점해 인간 주석 불필요
왜 중요한가?
SFT는 토큰 단위 학습이라 반복 루프를 완결 수준 실패로 벌하지 못하는데, DPO가 완결 단위로 실패를 명시적으로 억제해 추출 품질 손상 없이 구조적 생성 신뢰성을 높이는 일반화 가능한 방법을 제시한다.
직접 선호도 최적화(Direct Preference Optimization, DPO) 기술이 챗봇을 넘어 다른 AI 영역으로 확장된다는 소식은 국내 AI 개발자들에게 중요한 시사점을 제공합니다. 한국 시장에서 다양한 AI 서비스에 대한 사용자 만족도 향상 및 윤리적 AI 구현에 기여할 수 있는 기술적 발전으로 주목할 만합니다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 23:39AI 초안

