포지큐브의 문서 비전언어모델(DVLM)이 멀티모달 AI 벤치마크 'OCR벤치 v2' 영어 부문에서 평균 69.8점을 기록해 국내 1위, 글로벌 2위에 올랐다. 이 모델은 오픈소스 비전언어모델에 자체 데이터와 강화학습을 결합했으며, 텍스트 그라운딩과 문서·표·수식 구조 이해를 강화한 데이터로 추가 학습했다. 특히 '그룹 시퀀스 정책 최적화(GSPO)' 강화학습으로 과제별 학습 포맷과 보상 기준을 설계해 복합 시각 정보 처리 안정성을 높였다. 포지큐브는 이번 성과를 발판으로 금융·공공·제조 등 문서 데이터가 많은 산업에 멀티모달 AI 적용을 확대할 계획이다.
- •OCR벤치 v2 영어 부문에서 평균 69.8점으로 국내 1위, 글로벌 2위 달성
- •오픈소스 VLM에 자체 데이터·강화학습을 결합해 텍스트 그라운딩과 문서·표·수식 구조 이해력 강화
- •'그룹 시퀀스 정책 최적화(GSPO)' 강화학습으로 과제별 보상 기준 설계
- •금융·공공·제조 등 문서 중심 산업에 멀티모달 AI 적용 확대 계획
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
포지큐브 DVLM, ‘OCR벤치 v2’ 국내 1위·글로벌 2위
- 1.포지큐브 문서비전언어모델(DVLM), 멀티모달 벤치마크 'OCR벤치 v2' 영어부문에서 평균 69.8점으로 국내 1위·글로벌 2위
- 2.단순 문자인식을 넘어 텍스트 위치·문서 구조화·차트·수식 이해·지식 기반 추론까지 평가하는 벤치마크
- 3.오픈소스 VLM에 자체 구축 데이터와 '그룹 시퀀스 정책 최적화(GSPO)' 강화학습을 결합해 성능 고도화
- 4.금융·공공·제조 등 문서 중심 산업으로 대기업 AI 적용을 확대할 계획
왜 중요한가?
기존 OCR이 문자 인식 정확도에 머물렀다면 이 모델은 문서·표·수식의 구조화와 시각 정보 기반 추론까지 국제 기준에서 검증받았다는 점에서, 문서 처리량이 많은 금융·공공·제조 분야에 실제 도입 가능한 국산 멀티모달 AI 경쟁력을 보여준다.
본문 미리보기
포지큐브(대표 오성조)는 ‘도큐먼트 비전언어모델(DVLM)’이 멀티모달 AI 국제 벤치마크인 ‘OCR벤치 v2’에서 국내 1위, 글로벌 2위를 달성했다고 24일 밝혔다.포지큐브의 멀티모달 AI 모델은 영어 부문 공식 리더보드에서 평균 69.8점을 기록하며 국내 모델 가운데 가장 높은 순위에 올랐다. 단순 문자 인식을 넘어 텍스트의 위치를 파악하고 문서와 시각 정보를 구조화·이해·추론하는 기술력을 인정받은 것이라는 설명이다.OCR벤치 v2는 멀티모달 언어모델이 이미지 속 문자와 시각 정보를 얼마나 정확하게 인식하고 이해하는지를 종합적
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
