구글이 10월 6일 텍스트·코드·이미지·비디오·오디오를 하나의 벡터 공간에서 처리하는 온디바이스 멀티모달 임베딩 모델 '임베딩젬마 2'를 공개했다. 젬마 4 아키텍처 기반 7억4000만 매개변수 모델로 아파치 2.0 라이선스로 공개됐으며, 최대 8192토큰 컨텍스트에서 이미지 29장, 비디오 58프레임, 오디오 5.5분을 함께 처리할 수 있다. MTEB 코드 벤치마크에서 78.68점으로 전작보다 9.92점 올랐고, 마트료시카 표현 학습으로 벡터 차원을 줄여 저장공간을 최대 6배 절감했다. 픽셀11 프로 기준 전체 모델 구동에 약 567MB RAM만 필요해, 클라우드 의존 없이 오프라인으로 작동하는 검색·RAG 시스템 구축을 지원한다.
- •텍스트·코드·이미지·비디오·오디오를 하나의 벡터 공간에서 처리하는 7억4000만 매개변수 모델
- •MTEB 코드 벤치마크 78.68점으로 전작 대비 9.92점 상승
- •마트료시카 표현 학습으로 벡터 차원 축소, 저장공간 최대 6배 절감
- •픽셀11 프로에서 멀티모달 모델 구동 시 약 567MB RAM만 사용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글, 온디바이스 ‘임베딩젬마 2’ 공개…텍스트·이미지·음성 통합 처리
- 1.구글, 텍스트·코드·이미지·비디오·오디오 통합 처리하는 온디바이스 임베딩 모델 '임베딩젬마 2' 공개
- 2.젬마 4 기반 7억4000만 매개변수, 아파치 2.0 라이선스로 상업적 활용 가능
- 3.컨텍스트 최대 8192토큰으로 전작 대비 4배 확대, MTEB 코드 78.68점으로 9.92점 향상
- 4.마트료시카 표현학습으로 벡터 차원 축소, 저장공간 최대 6배 절감·픽셀11 프로 567MB RAM 사용
왜 중요한가?
클라우드 의존 없이 기기에서 멀티모달 검색·RAG를 구동할 수 있는 경량 임베딩 모델을 오픈소스로 공개해, 온디바이스 AI 검색과 개인정보 보호형 RAG 생태계 확산을 가속할 수 있다.
본문 미리보기
구글이 기기 안에서 다양한 형태의 데이터를 연결하고 검색할 수 있는 온디바이스 AI 기술을 확장했다. 대규모 클라우드 모델에 의존하지 않고도 여러 데이터를 빠르게 처리할 수 있도록 경량화한 멀티모달 임베딩 모델을 선보였다.구글은 6일(현지시간) 스마트폰과 PC 같은 소비자 기기에서 직접 실행할 수 있는 경량 멀티모달 임베딩 모델 ‘임베딩젬마 2(EmbeddingGemma 2)’를 공개했다.텍스트뿐 아니라 코드, 이미지, 비디오, 오디오까지 하나의 벡터 공간에서 처리할 수 있도록 확장해 온디바이스 검색과 검색증강생성(RAG) 활용 범
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

