[모델]구글, 온디바이스 멀티모달 임베딩 모델 'EmbeddingGemma 2' 공개
구글이 텍스트, 코드, 이미지, 비디오, 오디오를 하나의 임베딩 공간으로 통합하는 소형 모델 'EmbeddingGemma 2'를 공개했습니다. 740M 파라미터 크기로 온디바이스 환경에 최적화되었으며, 상업적 이용이 가능한 Apache 2.0 라이선스로 배포됩니다.
전문 읽기접기
무슨 일이야
구글이 온디바이스 멀티모달 임베딩 모델인 EmbeddingGemma 2를 발표했습니다. 기존 텍스트 중심이었던 1세대에서 확장되어 텍스트와 코드뿐만 아니라 이미지, 영상, 오디오까지 단일 임베딩 공간에 매핑하는 것이 특징입니다. 음성 메모로 특정 비디오 클립을 찾거나, 텍스트 검색으로 긴 오디오 녹음본을 찾는 등의 교차 모달리티 검색을 단일 모델로 처리할 수 있습니다.
이번 모델은 Gemma 4 아키텍처를 기반으로 구축되었으며 매개변수는 740M(7억 4,000만 개) 규모입니다. 성능 면에서는 이전 세대의 다국어 텍스트 처리 능력을 유지하면서 코드 벤치마크(MTEB Code) 점수를 68.76에서 78.68로 9.92점 끌어올렸습니다. 구글은 1B 이하 모델 기준으로 높은 효율을 보여주며, 일부 항목에서는 크기가 2배 이상 큰 특화 모델보다 뛰어난 성능을 낸다고 밝혔습니다.
왜 중요해
엣지 디바이스에서 모든 임베딩을 로컬로 처리할 수 있어, 네트워크 연결 없는 오프라인 환경에서도 개인정보 유출 걱정 없이 멀티모달 검색 기능을 구현할 수 있습니다. 특히 로컬 코드베이스 인덱싱이나 코딩 에이전트용 검색 엔진을 가볍게 구축하려는 개발자들에게 유용합니다.
또한 Gemma 4와 텍스트 토크나이저 및 오디오 인코더를 공유하도록 설계되었습니다. 덕분에 Gemma 4와 함께 온디바이스 RAG 파이프라인을 구성할 때 메모리 사용량을 크게 줄일 수 있어, 하드웨어 리소스가 제한적인 환경에서도 복합 파이프라인 구동이 훨씬 수월해집니다.
참고: DeepMind
댓글 0
첫 댓글을 남겨보세요.