EmbeddingGemma 2: открытая мультимодальная модель эмбеддингов на 740M параметров

Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов на 740M параметров, которая переводит текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство. Модель распространяется по лицензии Apache 2.0, поддерживает контекст 8K токенов и рассчитана на поиск, классификацию и RAG прямо на устройстве.

Веса уже доступны на Hugging Face и Kaggle, а также в сборках для Ollama, llama.cpp GGUF и LiteRT. То есть развернуть модель можно сегодня, не дожидаясь облачных API. Это продолжает линию Google DeepMind на открытые модели — как в случае с Gemini 3.8 Flash и Flash Cyber, выпущенными с разными уровнями доступа.

Зачем нужна модель эмбеддингов

Модель эмбеддингов превращает контент в вектор чисел, отражающий смысл. Похожие элементы оказываются рядом друг с другом, поэтому их легко искать и сравнивать. В конвейере RAG такие векторы позволяют языковой модели подтягивать свежую информацию, которой не было в обучающей выборке. Локальная генерация эмбеддингов оставляет данные на устройстве, снижает задержку и работает без сети.

Одно пространство для всех модальностей

EmbeddingGemma 2 построена на архитектуре Gemma 4. Текстовый запрос может найти фотографию, голосовая заметка — видеоклип. Смешанные входные данные, например карточка товара с текстом, изображениями и демонстрационным видео, дают один общий эмбеддинг.

Архитектура модульная и состоит из трёх частей:

  • Текстовый и кодовый бэкбон: 270M параметров (130M трансформер плюс 140M эмбеддер).
  • Кодировщик изображений: 170M параметров, опционально.
  • Кодировщик аудио: 300M параметров, опционально.

Разработчики загружают только то, что нужно: 270M для текста, 440M для текста и изображений, 570M для текста и аудио или 740M для всего сразу. Все конфигурации используют одно векторное пространство, поэтому запрос, построенный текстовой версией, может сопоставляться с документами, которые обработала полная модель.

Контекстное окно — 8 192 токена, вчетверо больше, чем у первой версии. В него помещается примерно 29 изображений, 58 видеокадров или 5,5 минуты аудио.

Результаты бенчмарков

Команда Google Research сообщает о лидирующих показателях среди мультимодальных моделей эмбеддингов размером менее 1B на MTEB Code и MAEB. Результаты в полной точности при 768 измерениях:

Бенчмарк EmbeddingGemma 2 EmbeddingGemma 1
MTEB multilingual v2 61.36 61.15
MTEB Code v1 78.68 68.76
MIEB lite (изображения) 64.64 —
MMEB v2 overall 59.01 —
MSEB retrieval (звук) 69.54 —
MAEB (аудио) 49.39 —

Поиск по коду прибавляет 9,92 балла, то есть примерно 14%. Качество многоязычного текста остаётся на прежнем уровне. Более крупные модели по-прежнему лидируют в некоторых рейтингах: Qwen3-VL-Embedding-2B заявляет 73.2 в собственном прогоне MMEB-V2 при примерно 2,7 раза большем числе параметров и без поддержки аудио.

Оптимизация под телефоны и ноутбуки

С квантованием на Pixel 11 Pro активная оперативная память составляет около 191MB для текстовых весов. Полной мультимодальной модели требуется порядка 567MB. Обучение с учётом квантования сжимает веса до INT4 и INT8. Команда Google AI Edge замерила 37,3 мс на изображение на GPU MacBook M5 Pro при бюджете в 70 токенов на зрение.

Matryoshka Representation Learning (MRL) позволяет усекать векторы до 512, 256 или 128 измерений. Переход с 768 на 128 измерений сокращает хранение до 6 раз. При 256 измерениях показатель MTEB multilingual снижается лишь с 61.36 до 60.41. При 128 измерениях MMEB падает до 45.65, поэтому Google рекомендует 128 измерений в основном для текстовых задач.

Сравнение с ближайшими конкурентами

Характеристика EmbeddingGemma 2 EmbeddingGemma 1 Qwen3-VL-Embedding-2B LCO-Embedding-Omni-3B Gemini Embedding 2
Разработчик Google DeepMind Google DeepMind Alibaba Qwen LCO-Embedding (исследование) Google
Параметры 740M (270M только текст) 308M 2B 3B бэкбон (5B на HF) Не раскрыты
Текст / код Да Да Да Да Да
Изображения Да Нет Да Да Да
Видео Да Нет Да Да Да
Аудио Да Нет Нет Да Да
Размерность выхода (MRL) 768 (512, 256, 128) 768 (до 128) До 2048 (64–2048) Не указано 3072 (128–3072)
Контекст 8 192 токена 2K токенов 32K токенов Не указано 8 192 токена
Языки 100+ 100+ 30+ Не указано 100+
Лицензия / доступ Apache 2.0, открытые веса Открытые веса (условия Gemma) Apache 2.0, открытые веса Apache 2.0, открытые веса Только платный API
Заявленная память на устройстве ~191MB текст, ~567MB полная Менее 200MB Не опубликовано Не опубликовано Только облако

Как запустить

Модель работает на sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant закрывает хранение векторов, Unsloth — дообучение. Поддержка ML Kit для Android с ускорением на NPU ожидается в течение нескольких недель.

pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

В Ollama достаточно выполнить ollama pull embeddinggemma-2. Теги идут от 270m (378MB) до 740m (1.3GB). Демонстрации доступны в Google AI Edge Gallery, подробности — в руководстве разработчика.

Что это значит для локального RAG

Один компактный набор весов закрывает сразу пять модальностей, а модульные кодировщики позволяют масштабировать занимаемую память от 270M до 740M параметров. Для сценариев, где данные нельзя выносить за пределы устройства, это снимает необходимость в облачном API эмбеддингов. Показатель MTEB Code вырос с 68.76 до 78.68, а вся модель укладывается примерно в 191–567MB оперативной памяти на Pixel 11 Pro при квантовании. Там, где нужен не поиск, а действия, пригодятся открытые computer-use модели Holo4 от H Company — они тоже рассчитаны на локальный запуск.

Частые вопросы

Можно ли использовать EmbeddingGemma 2 коммерчески?

Да, модель выпущена под лицензией Apache 2.0.

Сколько памяти нужно модели?

Google сообщает примерно о 191MB активной оперативной памяти для текстового режима и 567MB для полного мультимодального при квантовании на Pixel 11 Pro.

Какие модальности поддерживаются?

Текст, код, изображения, видео и аудио — все в одном 768-мерном пространстве.

Какой контекст у модели?

8 192 токена — вчетверо больше, чем у первой версии. Это примерно 29 изображений, 58 видеокадров или 5,5 минуты аудио.

Обязательно ли загружать все 740M параметров?

Нет. Архитектура модульная: 270M для текста, 440M для текста и изображений, 570M для текста и аудио, 740M для всего. Все конфигурации делят одно векторное пространство.

Можно ли уменьшить размер векторов?

Да, благодаря Matryoshka Representation Learning векторы усекаются до 512, 256 или 128 измерений. Переход с 768 на 128 измерений сокращает хранение до 6 раз, но качество на MMEB падает до 45.65, поэтому 128 измерений рекомендуют для текстовых задач.

Где взять веса?

Веса опубликованы на Hugging Face и Kaggle, есть сборки для Ollama, llama.cpp GGUF и LiteRT.

Как быстро работает на устройстве?

Команда Google AI Edge замерила 37,3 мс на изображение на GPU MacBook M5 Pro при бюджете в 70 токенов на зрение.

Какие инструменты поддерживаются?

sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Для хранения векторов — Qdrant, для дообучения — Unsloth.

Источник: marktechpost.com