EmbeddingGemma 2: открытая легковесная мультимодальная модель встраивания

EmbeddingGemma впервые представили в прошлом году как легковесный вариант для высококачественного встраивания текста, помогающий приложениям организовывать, искать и связывать информацию прямо на потребительском оборудовании. Ответ разработчиков превзошёл все ожидания: более 20 млн загрузок, и создатели использовали его для работы более умных локальных поисковых инструментов и приватных конвейеров retrieval augmented generation (RAG).

Сегодня запускается EmbeddingGemma 2, расширяющая возможности за рамки текста — объединяя код, изображения, видео и аудио в единое пространство встраивания. Построенная на архитектуре Gemma 4 и выпущенная под коммерчески свободной лицензией Apache 2.0, EmbeddingGemma 2 имеет 740 млн параметров, что делает её оптимальной для локального вывода. Она может найти конкретный видеофрагмент из голосовой заметки или искать в часах аудиозаписей по текстовому запросу — всё обрабатывается одной нативно мультимодальной моделью.

EmbeddingGemma 2

Лучшая производительность в своем классе для кода, видения и аудио

Построенная на той же технологии, что и модели Gemini Embedding, EmbeddingGemma 2 предлагает:

  • Лидирующие результаты для своего размера: Показывает ведущие баллы среди мультимодальных встраивателей менее 1B параметров по бенчмаркам MTEB (Massive Text Embedding Benchmark) Code и MAEB (Massive Audio Embedding Benchmark), при этом сравнивается или превосходит множество более крупных моделей по текстовым, визуальным и аудиозадачам.
  • Модульная архитектура: Требует всего 270M параметров для работы только с текстом, с опциональными энкодерами видения (170M) и аудио (300M) для полной мультимодальной поддержки.
  • Эффективна по памяти: Использует Matryoshka Representation Learning (MRL), позволяя разработчикам динамически обрезать векторы выхода с 768 до 512, 256 или 128 размерностей. Это обеспечивает вплоть до 6x сокращение хранилища для локальных векторных БД и использования памяти.
  • Оптимизирована для локального выполнения: Работает эффективно в жёстких условиях ресурсов. С квантизацией на Google Pixel 11 Pro EmbeddingGemma 2 требует всего ~191MB активной оперативной памяти для весов только текста и ~567MB для полной мультимодальной модели.
  • Готова к расширенному контексту: Имеет окно контекста 8K токенов (в 4 раза больше, чем EmbeddingGemma 1), позволяя обрабатывать до 5.5 минут аудио, 29 изображений, 58 видеокадров или их чередующихся комбинаций прямо на локальном оборудовании.

EmbeddingGemma 2 сохраняет сильную многоязычную текстовую производительность EmbeddingGemma, одновременно обеспечивая значительное улучшение на 9.92 пункта по производительности кода (в MTEB Code, с 68.76 до 78.68), что делает её хорошо подходящей для локального индексирования кодовой базы, семантического поиска кода и поиска при работе кодирующих агентов. По изображениям, видео, документам и аудио она устанавливает новый стандарт качества-на-параметр для моделей менее 1B и даже превосходит некоторые специализированные модели, в два раза превышающие её размер.

Massive Text Embedding Benchmark (Code) Massive Image Embedding Benchmark (Lite) Massive Audio Embedding Benchmark

Полные метрики оценки и информацию о модели найдёте в карточке модели EmbeddingGemma 2.

Семантический поиск, маршрутизация и поиск информации — полностью на устройстве

EmbeddingGemma 2 привносит мощные возможности прямо в граничное оборудование. Генерирование встраиваний локально помогает обеспечить приватность данных, снижает задержку конвейера и позволяет разработчикам создавать кросс-модальный поиск и поиск информации, работающие полностью офлайн.

В сочетании с генеративными моделями, такими как Gemma 4, EmbeddingGemma 2 позволяет использовать локальные RAG-конвейеры, понимающие сложные мультимодальные данные. Поскольку EmbeddingGemma 2 построена на Gemma 4 и использует её текстовый токенизатор и аудиоэнкодер, разработчики могут запускать обе модели вместе в едином конвейере с уменьшенным общим объёмом используемой памяти.

Используйте текст или изображение для поиска лучших совпадений в вашей медиатеке на основе семантического сходства. Попробуйте в Google AI Edge Gallery — Instant Media Search.

Находите конкретные моменты в видео, используя текстовые или аудиозапросы. Попробуйте в Google AI Edge Gallery — Video Moments Finder.

Сочетайте EmbeddingGemma 2 для локального поиска файлов с Gemma 4 для контекстного рассуждения. Попробуйте в приложении Google AI Edge Foresight.

Создавайте механизмы принятия решений в реальном времени, используя мультимодальный контекст для классификации, маршрутизации и предсказательных возможностей через MediaPipe Decision Task API.

Чтобы узнать, как создавать системы локального поиска и RAG с помощью LiteRT, прочитайте пост в блоге Google AI Edge.

Начните работу с EmbeddingGemma 2

Мы тесно сотрудничали со следующими партнёрами, чтобы обеспечить немедленную работу EmbeddingGemma 2 там, где вы разрабатываете:

  • Загрузите модели: Найдите веса моделей на Hugging Face и Kaggle, а доступность на Gemini Enterprise Agent Platform Model Garden скоро появится. Посетите LiteRT Community на Hugging Face для моделей, оптимизированных для локального использования.
  • Развёртывание на устройстве: Разрабатывайте кросс-платформенные приложения с помощью Google AI Edge MediaPipe для готовых к использованию встраивания, поиска и задач принятия решений или LiteRT для пользовательской интеграции моделей. Разрабатывайте для браузера с transformers.js или WebGPU.
  • Используйте свои любимые инструменты разработки: Развёртывайте модель эффективно с помощью transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio. Сохраняйте ваши векторы встраивания с помощью Qdrant.
  • Дообучение: Следуйте руководству от Unsloth по дообучению EmbeddingGemma 2 для ваших случаев использования.

Исследуйте наше руководство для разработчиков, документацию и руководства по выводу и дообучению.