
Google DeepMind EmbeddingGemma 2-ni buraxdı, cihazlar üçün çoxmodal embedding modeli
Google DeepMind EmbeddingGemma 2-ni buraxdı — mətn, şəkillər, audio və videonu cihazda axtarış üçün vahid embedding sahəsinə yerləşdirən açıq 740 milyon parametrli model.
Vahid çoxmodal embedding modeli
Google DeepMind EmbeddingGemma 2-ni təqdim etdi — mətn, şəkillər, audio və videonu vahid embedding sahəsinə yerləşdirən açıq və yüngül embedding modeli. O, Gemma 4 arxitekturasına əsaslanır və Apache 2.0 lisenziyası ilə yayılır. 740 milyon parametrli model cihazda işləmək üçün nəzərdə tutulub: o, səsli şərhdən konkret video klipin tapılmasını və ya bir neçə saatlıq audio yazıda mətn sorğusu ilə lokal axtarışı tək model ilə həyata keçirə bilər.
EmbeddingGemma 2 ilk EmbeddingGemma-nın ardınca gəlir, o, 20 milyondan çox yükləmə toplamışdı və cihazda axtarışa və məxfiliyə yönəlmiş RAG-də istifadə olunurdu. Yeni versiya mətnin yanı sıra kodu, şəkilləri, videonu və audionu ümumi sahədə birləşdirir.
Modul və yaddaşa qənaətli dizayn
EmbeddingGemma 2 moduldur. Mətn üçün 270 milyon parametr kifayətdir, tam çoxmodal dəstək üçün isə vizual (170 milyon) və audio (300 milyon) enkoderlər əlavə olunur. Matryoshka Representation Learning ilə geliştiricilər vektorları 768 ölçüdən 512-ə, 256-ya və ya 128-ə qədər qısa bilərlər, bu da lokal vektor bazalarında 6 dəfədən az yer tələb edir.
Google Pixel 11 Pro-da kvantlaşdırma ilə mətn ağırlıqları təxminən 191MB aktiv RAM tutur, tam model isə təxminən 567MB. 8K token konteksti, EmbeddingGemma 1-də dörd dəfə böyükdür və lokal olaraq 5,5 dəqiqəyə qədər audio, 29 şəkil, 58 video kadr və ya onların kombinasiyasını təmin edir.
Effektivlik benchmarklərdə
Google DeepMind-in sözləsinə görə, EmbeddingGemma 2 MTEB Code və MAEB-də 1B-dən az parametri olan çoxmodal enkoderlər arasında ən yaxşıdır, mətn, görüntü və audioda isə bir çox daha böyük modeli üstələyir və ya rəqabətə davam edir. Kod üzrə nəticə MTEB Code-da 68,76-dan 78,68-ə qədər yaxşılaşıb, yəni 9,92 bal artıb, bu da onu lokal kod bazası indeksləmə, semantik axtarış və kodlaşdırma agentləri üçün əlverəli edir. Şəkillərdə, videoda, sənədlərdə və audioda 1B-dən az modellər arasında keyfiyyət yeni standartını qurur və bəzi dəfələrdə iki dəfədən böyük ixtisaslaşmış modelləri belə üstələyir.
Çatcıllıq və cihazda istifadə
Ağırlıqlar Hugging Face və Kaggle-də əlçatandır, Gemini Enterprise Agent Platform Model Garden-də isə tezliklə görünəcək. Model transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama və LMStudio ilə işləyir, vektorların saxlanması isə Qdrant ilə mümkündür. Təkmilləşdirmə təlimatını Unsloth verir.
Geliştiricilər EmbeddingGemma 2-ni Google AI Edge Gallery-nin Instant Media Search və Video Moments Finder-də sınaya bilərlər, Gemma 4 ilə RAG üçün Google AI Edge Foresight tətbiqində birləşdirə bilərlər və ya MediaPipe Decision Task API ilə real vaxtda işləyən qərarlar mühərriki qura bilərlər. Cihazda işə salmanı Google AI Edge MediaPipe, LiteRT, transformers.js və WebGPU dəstəkləyir.
Mənbələr: blog.google
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.