
أطلقت Google DeepMind نموذج EmbeddingGemma 2، نموذج تضمين متعدد الوسائط للأجهزة
أطلقت Google DeepMind نموذج EmbeddingGemma 2، وهو نموذج مفتوح يحتوي على 740 مليون معامل، يضع النصوص والصور والصوت والفيديو في مساحة تضمين موحدة للبحث على الأجهزة.
نموذج تضمين موحد متعدد الوسائط
قدمت Google DeepMind نموذج EmbeddingGemma 2، وهو نموذج تضمين مفتوح وخفيف يضع النصوص والصور والصوت والفيديو في مساحة تضمين موحدة. وهو مبني على بنية Gemma 4 ويُنشر تحت ترخيص Apache 2.0. النموذج الذي يحتوي على 740 مليون معامل مصمم للعمل على الأجهزة: يمكنه البحث عن مقطع فيديو محدد من تعليق صوتي أو البحث في تسجيل صوتي يمتد لساعات عدة باستخدام استعلام نصي محلياً، بنموذج واحد.
يأتي EmbeddingGemma 2 بعد أول نموذج EmbeddingGemma، الذي جمع أكثر من 20 مليون تنزيل واستُخدم في RAG موجه للبحث على الأجهزة والسرية. يجمع الإصدار الجديد، بالإضافة إلى النصوص، الشيفرة والصور والفيديو والصوت في مساحة مشتركة واحدة.
تصميم معياري وفعال في التخزين
EmbeddingGemma 2 معياري. للنصوص يكفي 270 مليون معامل، وللدعم الكامل متعدد الوسائط تُضاف مُشفرات بصرية (170 مليون) وصوتية (300 مليون). باستخدام Matryoshka Representation Learning يمكن للمطورين تقليل المتجهات من 768 بُعداً إلى 512 أو 256 أو 128، مما يتطلب مساحة أقل بست مرات في قواعد البيانات المتجهة المحلية.
على Google Pixel 11 Pro مع التكميم، تشغل الأوزان النصية حوالي 191MB من ذاكرة RAM النشطة، بينما يشغل النموذج الكامل حوالي 567MB. سياق 8K رمز، أكبر بأربع مرات من EmbeddingGemma 1، يدعم محلياً ما يصل إلى 5,5 دقيقة من الصوت أو 29 صورة أو 58 إطار فيديو أو مزيجاً منها.
الأداء في المعايير المرجعية
وفقاً لـ Google DeepMind، يُعد EmbeddingGemma 2 الأفضل بين المُشفرات متعددة الوسائط ذات المعاملات الأقل من 1B في MTEB Code وMAEB، بينما يتفوق على نماذج أكبر بكثير أو ينافسها في النصوص والرؤية والصوت. تحسنت النتيجة في الشيفرة في MTEB Code من 68,76 إلى 78,68، أي بفارق 9,92 نقطة، مما يجعله مناسباً لفهرسة قواعد الشيفرة المحلية والبحث الدلالي ووكلاء الترميز. في الصور والفيديو والمستندات والصوت، يرسّخ معياراً جديداً للجودة بين النماذج الأقل من 1B ويتفوق حتى على بعض النماذج المتخصصة الأكبر حجماً.
التوفر والاستخدام على الأجهزة
الأوزان متاحة على Hugging Face وKaggle، وستظهر قريباً في Model Garden الخاص بـ Gemini Enterprise Agent Platform. يعمل النموذج مع transformers وsentence-transformers وMLX وvLLM وllama.cpp وSGLang وOllama وLMStudio، ويمكن تخزين المتجهات باستخدام Qdrant. توفر Unsloth تعليمات الصقل.
يمكن للمطورين تجربة EmbeddingGemma 2 في Instant Media Search وVideo Moments Finder ضمن Google AI Edge Gallery، أو إقرانه مع Gemma 4 لأغراض RAG في تطبيق Google AI Edge Foresight، أو بناء محركات قرارات فورية باستخدام MediaPipe Decision Task API. يدعم التشغيل على الأجهزة عبر Google AI Edge MediaPipe وLiteRT وtransformers.js وWebGPU.
المصادر: blog.google
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.