6 октября 2026 года Google DeepMind представила EmbeddingGemma 2 — мультимодальную embedding-модель с открытыми весами на 740 миллионов параметров, которая преобразует текст, код, изображения, аудио и видео в числовые векторы в едином пространстве размерностью 768. Модель основана на архитектуре Gemma 4 и распространяется под лицензией Apache 2.0, разрешающей коммерческое использование — по словам Google, это делает её оптимальной для инференса на устройстве.
В официальном анонсе в блоге компания перечисляет пять ключевых особенностей новой модели: ведущее качество относительно размера, модульный дизайн, экономия памяти, оптимизация для устройств и расширенное контекстное окно.
Лидерство в бенчмарках
EmbeddingGemma 2 построена на технологиях моделей Gemini Embedding и, по заявлению Google, показывает лучшее качество среди мультимодальных embedding-моделей с менее чем миллиардом параметров относительно своего размера — в частности, в бенчмарках MTEB Code и MAEB. Наиболее заметен прирост в работе с кодом: показатель MTEB Code вырос с 68,76 до 78,68, то есть на 9,92 процентных пункта. Google отмечает, что это можно применять для индексации локальных кодовых баз, семантического поиска по коду и получения данных для кодовых агентов.
Модель также установила новый стандарт для моделей с менее чем миллиардом параметров по изображениям, видео, документам и аудио, превзойдя в ряде случаев даже некоторые узкоспециализированные модели — вдвое большие по размеру. Google сообщила, что опубликовала полные результаты оценок и данные о модели в карточке модели EmbeddingGemma 2.
Предыдущая версия — EmbeddingGemma — вышла в прошлом году как лёгкое текстовое embedding-решение для прямого ранжирования, поиска и связывания информации на потребительских устройствах. По словам Google, отклик сообщества разработчиков превзошёл ожидания: модель скачали более 20 миллионов раз, её использовали в поисковых инструментах на устройствах и в приватных RAG-цепочках. Вторая версия вышла именно на этом фундаменте, добавив код, изображения, видео и аудио.
EmbeddingGemma 2 использует тот же текстовый токенизатор и аудиоэнкодер, что и Gemma 4, поэтому при совместном запуске двух моделей в одной цепочке общий расход памяти снижается. Google заявляет, что в связке с генеративными моделями — например Gemma 4 — можно создавать RAG-цепочки, работающие на устройстве и понимающие сложные мультимодальные данные.
Работа на устройстве и приватность
Модель имеет модульную структуру: для работы только с текстом достаточно 270 миллионов параметров, а для полного мультимодального режима добавляются зрительный энкодер на 170 миллионов параметров и аудиоэнкодер на 300 миллионов параметров. С квантованием на Pixel 11 Pro текстовые веса в активном состоянии потребляют около 191 МБ оперативной памяти, а для полной мультимодальной модели этот показатель составляет около 567 МБ.
По утверждению Google DeepMind, EmbeddingGemma 2 позволяет создавать системы поиска, ранжирования и извлечения данных, работающие на повседневных устройствах без подключения к облаку.
Создание эмбеддингов локально помогает обеспечить приватность данных, снижает задержки и открывает возможность строить полностью офлайн-работающие системы межмодального поиска.
Контекстное окно составляет 8 тысяч токенов — это в четыре раза больше, чем в первой версии. По сообщению Google, в такое окно помещается до 5,5 минуты аудио, 29 изображений или 58 видеокадров, и всё это обрабатывается на локальном оборудовании. В качестве практических примеров компания приводит поиск нужного видеофрагмента по голосовому напоминанию или поиск в многочасовых аудиозаписях по текстовому запросу.
Подгонка размерности векторов и экономия памяти
Метод Matryoshka Representation Learning позволяет разработчикам динамически сокращать выходные векторы с 768 измерений до 512, 256 или 128. Это обеспечивает до 6-кратной экономии памяти в локальных векторных базах данных.
Экосистема и доступность
Веса модели доступны на платформах Hugging Face и Kaggle; поддерживаются такие инструменты, как Transformers, sentence-transformers, vLLM, llama.cpp, MLX, Ollama и SGLang. Указана совместимость с Qdrant для хранения векторов, а по тонкой настройке опубликовано руководство Unsloth.
Для развёртывания на устройствах Google предлагает два пути платформы Google AI Edge: MediaPipe для готовых задач эмбеддинга, поиска и принятия решений и LiteRT для пользовательской интеграции. Также отмечена возможность запуска в браузере через transformers.js или WebGPU. На странице сообщества LiteRT в Hugging Face размещены оптимизированные для устройств модели. Google сообщила, что опубликовала для разработчиков руководство, документацию, а также инструкции по инференсу и тонкой настройке. Google также сообщила, что в приложение AI Edge Gallery скоро будут добавлены функции «Instant Media Search» и «Video Moments Finder». Страница модели Google DeepMind описывает EmbeddingGemma 2 как предназначенную для поисковых, ранжирующих и извлекательных систем, работающих на повседневных устройствах без зависимости от облака.
