H컴퍼니가 처음부터 학습한 2억6천만·8억 파라미터 규모의 멀티모달·다국어 인코더 'NeoMME'를 아파치 2.0 라이선스로 공개했다. 기존 시각문서 검색 모델과 달리 사전학습된 비전 인코더나 인과적 언어모델 없이 하나의 양방향 트랜스포머로 텍스트와 이미지 패치를 함께 처리하며, 마스크드 확산 방식으로 텍스트를 복원하도록 학습했다. 검색용 파생 모델인 NeoMME-Retriever는 ViDoRe v3 벤치마크에서 260M 모델이 nDCG@10 0.523을 기록해 8억 파라미터 미만 모델 중 최고 성능을 냈고, ColQwen2.5보다 14배 적은 파라미터로 근접한 성능을 달성했다. 계층적 토큰 풀링과 비대칭 양자화를 결합해 페이지당 저장 용량을 최대 255배 줄이면서도 검색 품질의 95% 이상을 유지했다.
- •H컴퍼니가 260M·800M 파라미터의 멀티모달·다국어 인코더 NeoMME를 아파치 2.0으로 공개했다.
- •사전학습된 비전 인코더나 인과적 디코더 없이 하나의 양방향 트랜스포머로 텍스트와 이미지를 함께 처리한다.
- •NeoMME-Retriever-260M은 ViDoRe v3에서 nDCG@10 0.523으로 800M 미만 모델 중 최고 성능을 기록했다.
- •ColQwen2.5 대비 약 14배 적은 파라미터로 0.002 차이의 근접한 성능을 달성했다.
- •토큰 풀링과 양자화로 late-interaction 저장 용량을 페이지당 최대 255배 절감했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
H Company Releases NeoMME, an Open-Source Multimodal Encoder Family

- 1.H컴퍼니가 2.6억·8억 파라미터 오픈소스 멀티모달 인코더 'NeoMME'를 아파치 2.0으로 공개(9월 3일)
- 2.ViDoRe v3에서 8억 모델 nDCG@10 0.556, 최상위권 모델 성능에 4~14배 적은 파라미터로 근접
- 3.사전학습된 비전 인코더·디코더 없이 텍스트·이미지를 하나의 양방향 트랜스포머로 처음부터 학습
- 4.압축 기법으로 페이지당 저장 용량을 최대 255배(6KB) 줄이면서도 검색 품질 95% 이상 유지
왜 중요한가?
대형 비전-언어모델에서 파생하지 않고 처음부터 학습한 소형 인코더가 최상위권 검색 모델과 맞먹는 성능을 훨씬 적은 파라미터로 내면서, 문서 검색 인프라 비용을 크게 낮출 수 있는 오픈소스 대안을 제시한다.
본문 미리보기
H Company researchers released NeoMME on September 3, 2026, a family of 260M- and 800M-parameter multimodal and multilingual encoders trained from scratch and published under the Apache 2.0 license. Fine-tuned retrieval variants sit on the model-size Pareto frontier of the ViDoRe v3 visual document retrieval benchmark, the team reported. According to the release post, many recent visual document retrievers are adapted from pretrained generative vision-language models, in which a separately…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
