Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов на 740M параметров, которая переводит текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство. Модель распространяется по лицензии Apache 2.0, поддерживает контекст 8K токенов и рассчитана на поиск, классификацию и RAG прямо на устройстве.
Веса уже доступны на Hugging Face и Kaggle, а также в сборках для Ollama, llama.cpp GGUF и LiteRT. То есть развернуть модель можно сегодня, не дожидаясь облачных API. Это продолжает линию Google DeepMind на открытые модели — как в случае с Gemini 3.8 Flash и Flash Cyber, выпущенными с разными уровнями доступа.
Зачем нужна модель эмбеддингов
Модель эмбеддингов превращает контент в вектор чисел, отражающий смысл. Похожие элементы оказываются рядом друг с другом, поэтому их легко искать и сравнивать. В конвейере RAG такие векторы позволяют языковой модели подтягивать свежую информацию, которой не было в обучающей выборке. Локальная генерация эмбеддингов оставляет данные на устройстве, снижает задержку и работает без сети.
Одно пространство для всех модальностей
EmbeddingGemma 2 построена на архитектуре Gemma 4. Текстовый запрос может найти фотографию, голосовая заметка — видеоклип. Смешанные входные данные, например карточка товара с текстом, изображениями и демонстрационным видео, дают один общий эмбеддинг.
Архитектура модульная и состоит из трёх частей:
- Текстовый и кодовый бэкбон: 270M параметров (130M трансформер плюс 140M эмбеддер).
- Кодировщик изображений: 170M параметров, опционально.
- Кодировщик аудио: 300M параметров, опционально.
Разработчики загружают только то, что нужно: 270M для текста, 440M для текста и изображений, 570M для текста и аудио или 740M для всего сразу. Все конфигурации используют одно векторное пространство, поэтому запрос, построенный текстовой версией, может сопоставляться с документами, которые обработала полная модель.
Контекстное окно — 8 192 токена, вчетверо больше, чем у первой версии. В него помещается примерно 29 изображений, 58 видеокадров или 5,5 минуты аудио.
Результаты бенчмарков
Команда Google Research сообщает о лидирующих показателях среди мультимодальных моделей эмбеддингов размером менее 1B на MTEB Code и MAEB. Результаты в полной точности при 768 измерениях:
| Бенчмарк | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (изображения) | 64.64 | — |
| MMEB v2 overall | 59.01 | — |
| MSEB retrieval (звук) | 69.54 | — |
| MAEB (аудио) | 49.39 | — |
Поиск по коду прибавляет 9,92 балла, то есть примерно 14%. Качество многоязычного текста остаётся на прежнем уровне. Более крупные модели по-прежнему лидируют в некоторых рейтингах: Qwen3-VL-Embedding-2B заявляет 73.2 в собственном прогоне MMEB-V2 при примерно 2,7 раза большем числе параметров и без поддержки аудио.
Оптимизация под телефоны и ноутбуки
С квантованием на Pixel 11 Pro активная оперативная память составляет около 191MB для текстовых весов. Полной мультимодальной модели требуется порядка 567MB. Обучение с учётом квантования сжимает веса до INT4 и INT8. Команда Google AI Edge замерила 37,3 мс на изображение на GPU MacBook M5 Pro при бюджете в 70 токенов на зрение.
Matryoshka Representation Learning (MRL) позволяет усекать векторы до 512, 256 или 128 измерений. Переход с 768 на 128 измерений сокращает хранение до 6 раз. При 256 измерениях показатель MTEB multilingual снижается лишь с 61.36 до 60.41. При 128 измерениях MMEB падает до 45.65, поэтому Google рекомендует 128 измерений в основном для текстовых задач.
Сравнение с ближайшими конкурентами
| Характеристика | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| Разработчик | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (исследование) | |
| Параметры | 740M (270M только текст) | 308M | 2B | 3B бэкбон (5B на HF) | Не раскрыты |
| Текст / код | Да | Да | Да | Да | Да |
| Изображения | Да | Нет | Да | Да | Да |
| Видео | Да | Нет | Да | Да | Да |
| Аудио | Да | Нет | Нет | Да | Да |
| Размерность выхода (MRL) | 768 (512, 256, 128) | 768 (до 128) | До 2048 (64–2048) | Не указано | 3072 (128–3072) |
| Контекст | 8 192 токена | 2K токенов | 32K токенов | Не указано | 8 192 токена |
| Языки | 100+ | 100+ | 30+ | Не указано | 100+ |
| Лицензия / доступ | Apache 2.0, открытые веса | Открытые веса (условия Gemma) | Apache 2.0, открытые веса | Apache 2.0, открытые веса | Только платный API |
| Заявленная память на устройстве | ~191MB текст, ~567MB полная | Менее 200MB | Не опубликовано | Не опубликовано | Только облако |
Как запустить
Модель работает на sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Qdrant закрывает хранение векторов, Unsloth — дообучение. Поддержка ML Kit для Android с ускорением на NPU ожидается в течение нескольких недель.
pip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))
В Ollama достаточно выполнить ollama pull embeddinggemma-2. Теги идут от 270m (378MB) до 740m (1.3GB). Демонстрации доступны в Google AI Edge Gallery, подробности — в руководстве разработчика.
Что это значит для локального RAG
Один компактный набор весов закрывает сразу пять модальностей, а модульные кодировщики позволяют масштабировать занимаемую память от 270M до 740M параметров. Для сценариев, где данные нельзя выносить за пределы устройства, это снимает необходимость в облачном API эмбеддингов. Показатель MTEB Code вырос с 68.76 до 78.68, а вся модель укладывается примерно в 191–567MB оперативной памяти на Pixel 11 Pro при квантовании. Там, где нужен не поиск, а действия, пригодятся открытые computer-use модели Holo4 от H Company — они тоже рассчитаны на локальный запуск.
Частые вопросы
Можно ли использовать EmbeddingGemma 2 коммерчески?
Да, модель выпущена под лицензией Apache 2.0.
Сколько памяти нужно модели?
Google сообщает примерно о 191MB активной оперативной памяти для текстового режима и 567MB для полного мультимодального при квантовании на Pixel 11 Pro.
Какие модальности поддерживаются?
Текст, код, изображения, видео и аудио — все в одном 768-мерном пространстве.
Какой контекст у модели?
8 192 токена — вчетверо больше, чем у первой версии. Это примерно 29 изображений, 58 видеокадров или 5,5 минуты аудио.
Обязательно ли загружать все 740M параметров?
Нет. Архитектура модульная: 270M для текста, 440M для текста и изображений, 570M для текста и аудио, 740M для всего. Все конфигурации делят одно векторное пространство.
Можно ли уменьшить размер векторов?
Да, благодаря Matryoshka Representation Learning векторы усекаются до 512, 256 или 128 измерений. Переход с 768 на 128 измерений сокращает хранение до 6 раз, но качество на MMEB падает до 45.65, поэтому 128 измерений рекомендуют для текстовых задач.
Где взять веса?
Веса опубликованы на Hugging Face и Kaggle, есть сборки для Ollama, llama.cpp GGUF и LiteRT.
Как быстро работает на устройстве?
Команда Google AI Edge замерила 37,3 мс на изображение на GPU MacBook M5 Pro при бюджете в 70 токенов на зрение.
Какие инструменты поддерживаются?
sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT и MediaPipe. Для хранения векторов — Qdrant, для дообучения — Unsloth.
Источник: marktechpost.com