Назад
Google DeepMind випустила EmbeddingGemma 2, мультимодальну модель вбудовувань для пристроїв
SiTech AI Team3 хв читання

Google DeepMind випустила EmbeddingGemma 2, мультимодальну модель вбудовувань для пристроїв

Google DeepMind випустила EmbeddingGemma 2, відкриту модель із 740 мільйонами параметрів, яка розміщує текст, зображення, аудіо та відео в єдиному просторі вбудовувань для пошуку на пристрої.

Єдина мультимодальна модель вбудовувань

Google DeepMind представила EmbeddingGemma 2, відкриту та легку модель вбудовувань, яка розміщує текст, зображення, аудіо та відео в єдиному просторі вбудовувань. Вона побудована на архітектурі Gemma 4 і поширюється за ліцензією Apache 2,0. Модель із 740 мільйонами параметрів призначена для роботи на пристрої: вона може знаходити конкретний відеокліп за голосовою заміткою або шукати за текстовим запитом у кількагодинному аудіозаписі локально, однією моделлю.

EmbeddingGemma 2 слідує за першою EmbeddingGemma, яка зібрала понад 20 мільйонів завантажень і використовувалася в RAG, орієнтованому на пошук на пристрої та конфіденційність. Нова версія об'єднує текст, код, зображення, відео та аудіо в одному загальному просторі.

Модульний та ефективний щодо пам'яті дизайн

EmbeddingGemma 2 модульна. Для тексту достатньо 270 мільйонів параметрів, для повної мультимодальної підтримки додаються візуальний (170 мільйонів) та аудіо (300 мільйонів) енкодери. Завдяки Matryoshka Representation Learning розробники можуть зменшувати вектори з 768 вимірів до 512, 256 або 128, що вимагає до 6 разів менше місця в локальних векторних базах.

На Google Pixel 11 Pro з квантизацією текстові ваги займають приблизно 191MB активної RAM, а повна модель — приблизно 567MB. Контекст у 8K токенів, у чотири рази більший ніж у EmbeddingGemma 1, локально забезпечує до 5,5 хвилин аудіо, 29 зображень, 58 кадрів відео або їх комбінацію.

Ефективність у бенчмарках

За словами Google DeepMind, EmbeddingGemma 2 є найкращою серед мультимодальних енкодерів із менше ніж 1B параметрів у MTEB Code та MAEB, а в тексті, зорі та аудіо перевершує або конкурує з набагато більшими моделями. Результат для коду в MTEB Code покращився з 68,76 до 78,68, тобто на 9,92 пункти, що робить її придатною для індексації локальних кодових баз, семантичного пошуку та агентів кодування. У зображеннях, відео, документах та аудіо вона встановлює новий стандарт якості серед моделей із менше ніж 1B параметрів і перевершує деякі набагато більші спеціалізовані моделі.

Доступність та використання на пристрої

Ваги доступні на Hugging Face та Kaggle, а скоро з'являться в Gemini Enterprise Agent Platform Model Garden. Модель працює з transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama та LMStudio, а зберігати вектори можна за допомогою Qdrant. Інструкції до доопрацювання надає Unsloth.

Розробники можуть спробувати EmbeddingGemma 2 в Google AI Edge Gallery у Instant Media Search та Video Moments Finder, поєднати її з Gemma 4 для RAG в застосунку Google AI Edge Foresight або створити двигуни рішень у реальному часі за допомогою MediaPipe Decision Task API. Запуск на пристрої підтримується за допомогою Google AI Edge MediaPipe, LiteRT, transformers.js та WebGPU.

Джерела: blog.google

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.