구글 딥마인드가 텍스트·이미지·오디오·비디오를 하나의 임베딩 공간으로 매핑하는 온디바이스 멀티모달 임베딩 모델 EmbeddingGemma 2를 공개했다. Gemma 4 아키텍처 기반이며 Apache 2.0 라이선스로 공개된 7.4억 파라미터 모델로, 텍스트 전용은 2.7억, 선택적 비전(1.7억)과 오디오(3억) 인코더까지 더해 모듈식으로 쓸 수 있다. MTEB Code 벤치마크에서 68.76점에서 78.68점으로 9.92점 향상하는 등 코드·이미지·비디오·문서·오디오 전반에서 10억 미만 모델 중 최고 수준의 품질 대비 파라미터 효율을 달성했고, 2배 이상 큰 특화 모델을 능가하기도 했다. Matryoshka 표현 학습으로 출력 벡터를 768차원에서 512, 256, 128차원까지 동적으로 줄여 로컬 벡터 데이터베이스 저장 공간을 최대 6배 절감할 수 있고, 양자화 시 구글 픽셀 11 프로에서 텍스트 전용 약 191MB, 전체 멀티모달 약 567MB의 활성 RAM만 필요하다. 8K 토큰 컨텍스트로 최대 5.5분 오디오, 29개 이미지, 58개 비디오 프레임을 로컬에서 직접 처리할 수 있다.
- •텍스트·이미지·오디오·비디오를 통합 임베딩 공간으로 매핑하는 온디바이스 모델 EmbeddingGemma 2 공개
- •Gemma 4 기반 7.4억 파라미터, Apache 2.0 라이선스, 텍스트 전용은 2.7억까지 축소 가능한 모듈식 구조
- •MTEB Code 68.76→78.68점 등 10억 미만 모델 중 최고 품질 대비 파라미터 효율 달성
- •Matryoshka 표현 학습으로 임베딩 차원을 768→128까지 동적 축소, 저장 공간 최대 6배 절감
- •8K 토큰 컨텍스트로 최대 5.5분 오디오·29개 이미지·58개 비디오 프레임을 온디바이스에서 처리
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EmbeddingGemma 2: an open, lightweight multimodal embedding model
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)