H컴퍼니가 자체 블로그를 통해 260M·800M 파라미터의 멀티모달·다국어 인코더 NeoMME를 공개하며 기술적 세부사항을 상세히 설명했다. NeoMME는 사전학습된 비전 타워나 인과적 디코더 없이 하나의 양방향 트랜스포머로 텍스트 토큰과 32×32 이미지 패치를 함께 처리하며, 마스크드 이산 확산 방식으로 약 5,240억 토큰을 학습했다. 검색용 파생 모델 NeoMME-Retriever는 하나의 순전파로 밀집 임베딩과 late-interaction 임베딩을 동시에 반환하며, ViDoRe v3에서 260M 모델이 37억5천만 파라미터의 ColQwen2.5와 근소한 차이의 0.523 nDCG@10을 기록했다. 계층적 토큰 풀링과 비대칭 양자화로 저장 용량을 페이지당 최대 255배 줄였고, 모든 체크포인트는 아파치 2.0으로 허깅페이스 트랜스포머에 공개됐다.
- •NeoMME는 사전학습된 비전 타워나 디코더 없이 하나의 트랜스포머로 텍스트와 이미지를 함께 처리하는 260M·800M 인코더다.
- •약 5,240억 토큰(텍스트 전용 2,900억 포함)으로 처음부터 마스크드 확산 방식으로 학습됐다.
- •NeoMME-Retriever-260M은 ViDoRe v3에서 nDCG@10 0.523으로 37억5천만 파라미터의 ColQwen2.5와 0.002 차이를 보였다.
- •2048×2048 해상도에서 초당 51페이지를 인코딩해 ColModernVBERT 대비 약 2배 빠르다.
- •토큰 풀링과 양자화 조합으로 late-interaction 저장 용량을 페이지당 최대 255배(6kB) 절감했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NeoMME: an efficient Multimodal-native and Multilingual Encoder
- 1.NeoMME: 별도 비전 타워 없이 텍스트·이미지 패치를 한 양방향 트랜스포머로 처리하는 260M·800M 인코더
- 2.마스크드 이산 확산으로 처음부터 학습, ColPali 방식 NeoMME-Retriever는 한 순전파로 두 임베딩 산출
- 3.ViDoRe v3서 260M 모델이 800M 미만 중 최고 nDCG@10 0.523, ColQwen2.5 대비 파라미터 14분의 1
- 4.계층적 토큰 풀링·비대칭 양자화로 페이지당 저장량 1.5MB→6KB(255배) 압축, 품질 95% 이상 유지
왜 중요한가?
문서 이미지를 그대로 검색하는 비전 기반 RAG가 대형 VLM 인코더 없이도 대폭 작은 모델로 경쟁력 있는 성능을 낼 수 있음을 보여줘, 대규모 문서 검색 인프라의 비용을 크게 낮출 잠재력이 있다.
언급 프로젝트
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
