Google, 기기 내 멀티모달 검색용 EmbeddingGemma 2 공개
Google이 10월 6일 텍스트·코드·이미지·음성·영상을 같은 벡터 공간에 담는 EmbeddingGemma 2를 공개했다. 7억4000만 파라미터 모델로 Apache 2.0 라이선스를 적용했다. Google에 따르면 Pixel 11 Pro에서 양자화한 전체 모델 가중치의 활성 RAM은 약 567MB이며, 텍스트만 쓰면 약 191MB다.
Gemma 4 기반이며 텍스트 전용 구성은 2억7000만 파라미터다. 이미지 인코더 1억7000만 개와 음성 인코더 3억 개를 선택적으로 사용한다.
8K 토큰 문맥에서 음성 최대 5.5분, 이미지 29장, 영상 프레임 58개 또는 이들의 혼합 입력을 처리한다고 설명했다.
출력 벡터를 768차원에서 512·256·128차원으로 줄여 벡터 저장 용량을 최대 6분의 1로 낮출 수 있다.
가중치는 Hugging Face·Kaggle에서 제공하며, Gemini Enterprise Agent Platform Model Garden 지원은 추후 제공할 예정이다.
필요한 인코더만 선택하면 텍스트 검색부터 시작해 음성·영상 검색으로 확장할 수 있다.
원문
- EmbeddingGemma 2: an open, lightweight multimodal embedding modelGoogle · 원문 2026-10-07