
Google DeepMind, cihazlar için çoklu modlu gömme modeli EmbeddingGemma 2'yi yayınladı
Google DeepMind, metni, görüntüyü, sesi ve videoyu cihazda arama için tek bir gömme alanında birleştiren açık kaynaklı 740 milyon parametreli EmbeddingGemma 2 modelini yayınladı.
Birleşik çoklu modlu gömme modeli
Google DeepMind, metni, görüntüyü, sesi ve videoyu tek bir gömme alanında birleştiren açık ve hafif bir gömme modeli olan EmbeddingGemma 2'yi tanıttı. Gemma 4 mimarisi üzerine inşa edilmiştir ve Apache 2.0 lisansıyla dağıtılmaktadır. 740 milyon parametreye sahip model, cihazda çalışmak üzere tasarlanmıştır: sesli bir nottan belirli bir video klibini bulabilir veya birkaç saatlik ses kaydında metin sorgusuyla yerel olarak arama yapabilir, tek bir modelle.
EmbeddingGemma 2, 20 milyondan fazla indirme toplayan ve cihazda aramaya ve gizliliğe odaklı RAG'de kullanılan ilk EmbeddingGemma'yı takip ediyor. Yeni sürüm, metnin yanı sıra kodu, görüntüleri, videoyu ve sesi tek bir ortak alanda birleştiriyor.
Modüler ve depolama açısından verimli tasarım
EmbeddingGemma 2 modülerdir. Metin için 270 milyon parametre yeterlidir, tam çoklu modlu destek için görsel (170 milyon) ve ses (300 milyon) kodlayıcılar eklenir. Matryoshka Representation Learning ile geliştiriciler vektörleri 768 boyuttan 512'ye, 256'ya veya 128'e küçültebilir, bu da yerel vektör veritabanlarında 6 kata kadar daha az yer kaplar.
Google Pixel 11 Pro'da kuantizasyon ile metin ağırlıkları yaklaşık 191MB aktif RAM kaplar, tam model ise yaklaşık 567MB. EmbeddingGemma 1'e göre dört kat daha büyük olan 8K token bağlamı, yerel olarak 5,5 dakikaya kadar sesi, 29 görüntüyü, 58 video karesini veya bunların kombinasyonunu destekler.
Kıyaslamalardaki performans
Google DeepMind'e göre, EmbeddingGemma 2, 1B'den daha az parametreli çoklu modlu gömme modelleri arasında MTEB Code ve MAEB'de en iyisidir; metinde, görüntüde ve sesde ise çok daha büyük modelleri yarışır veya geçer. Kod konusunda sonuç MTEB Code'da 68,76'dan 78,68'e yükseldi, yani 9,92 puanla, bu da onu yerel kod tabanı indeksleme, anlamsal arama ve kodlama ajanları için uygun hale getirir. Görüntülerde, videolarda, belgelerde ve seslerde 1B'den daha küçük modeller arasında kalite için yeni bir standard oluşturur ve bazı kat kat büyük uzmanlı modelleri bile geçer.
Erişilebilirlik ve cihazda kullanım
Ağırlıklar Hugging Face ve Kaggle'da mevcuttur, Gemini Enterprise Agent Platform Model Garden'de ise yakında görünecektir. Model transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama ve LMStudio ile çalışır, vektörlerin saklanması ise Qdrant ile mümkündür. İnce ayar talimatlarını Unsloth sağlar.
Geliştiriciler EmbeddingGemma 2'yi Google AI Edge Gallery'nin Instant Media Search ve Video Moments Finder'da deneyebilir, RAG için Gemma 4 ile Google AI Edge Foresight uygulamasında birleştirebilir veya MediaPipe Decision Task API ile gerçek zamanlı karar verme motorları oluşturabilir. Cihazda çalıştırmayı Google AI Edge MediaPipe, LiteRT, transformers.js ve WebGPU destekler.
Kaynaklar: blog.google
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.