
Google DeepMind випустила EmbeddingGemma 2, мультимодальну модель вбудовувань для пристроїв
Google DeepMind випустила EmbeddingGemma 2, відкриту модель із 740 мільйонами параметрів, яка розміщує текст, зображення, аудіо та відео в єдиному просторі вбудовувань для пошуку на пристрої.
Єдина мультимодальна модель вбудовувань
Google DeepMind представила EmbeddingGemma 2, відкриту та легку модель вбудовувань, яка розміщує текст, зображення, аудіо та відео в єдиному просторі вбудовувань. Вона побудована на архітектурі Gemma 4 і поширюється за ліцензією Apache 2,0. Модель із 740 мільйонами параметрів призначена для роботи на пристрої: вона може знаходити конкретний відеокліп за голосовою заміткою або шукати за текстовим запитом у кількагодинному аудіозаписі локально, однією моделлю.
EmbeddingGemma 2 слідує за першою EmbeddingGemma, яка зібрала понад 20 мільйонів завантажень і використовувалася в RAG, орієнтованому на пошук на пристрої та конфіденційність. Нова версія об'єднує текст, код, зображення, відео та аудіо в одному загальному просторі.
Модульний та ефективний щодо пам'яті дизайн
EmbeddingGemma 2 модульна. Для тексту достатньо 270 мільйонів параметрів, для повної мультимодальної підтримки додаються візуальний (170 мільйонів) та аудіо (300 мільйонів) енкодери. Завдяки Matryoshka Representation Learning розробники можуть зменшувати вектори з 768 вимірів до 512, 256 або 128, що вимагає до 6 разів менше місця в локальних векторних базах.
На Google Pixel 11 Pro з квантизацією текстові ваги займають приблизно 191MB активної RAM, а повна модель — приблизно 567MB. Контекст у 8K токенів, у чотири рази більший ніж у EmbeddingGemma 1, локально забезпечує до 5,5 хвилин аудіо, 29 зображень, 58 кадрів відео або їх комбінацію.
Ефективність у бенчмарках
За словами Google DeepMind, EmbeddingGemma 2 є найкращою серед мультимодальних енкодерів із менше ніж 1B параметрів у MTEB Code та MAEB, а в тексті, зорі та аудіо перевершує або конкурує з набагато більшими моделями. Результат для коду в MTEB Code покращився з 68,76 до 78,68, тобто на 9,92 пункти, що робить її придатною для індексації локальних кодових баз, семантичного пошуку та агентів кодування. У зображеннях, відео, документах та аудіо вона встановлює новий стандарт якості серед моделей із менше ніж 1B параметрів і перевершує деякі набагато більші спеціалізовані моделі.
Доступність та використання на пристрої
Ваги доступні на Hugging Face та Kaggle, а скоро з'являться в Gemini Enterprise Agent Platform Model Garden. Модель працює з transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama та LMStudio, а зберігати вектори можна за допомогою Qdrant. Інструкції до доопрацювання надає Unsloth.
Розробники можуть спробувати EmbeddingGemma 2 в Google AI Edge Gallery у Instant Media Search та Video Moments Finder, поєднати її з Gemma 4 для RAG в застосунку Google AI Edge Foresight або створити двигуни рішень у реальному часі за допомогою MediaPipe Decision Task API. Запуск на пристрої підтримується за допомогою Google AI Edge MediaPipe, LiteRT, transformers.js та WebGPU.
Джерела: blog.google
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.