חזרה
Google DeepMind שוחררה את EmbeddingGemma 2, מודל embedding מולטימודלי למכשירים
SiTech AI Team2 דק׳ קריאה

Google DeepMind שוחררה את EmbeddingGemma 2, מודל embedding מולטימודלי למכשירים

Google DeepMind שוחררה את EmbeddingGemma 2, מודל פתוח עם 740 מיליון פרמטרים, המאחד טקסט, תמונות, אודיו ווידאו במרחב embedding אחד לצורך חיפוש על מכשירים.

מודל embedding מולטימודלי אחיד

Google DeepMind הציגה את EmbeddingGemma 2, מודל embedding פתוח וקל, המאחד טקסט, תמונות, אודיו ווידאו במרחב embedding אחיד. הוא בנוי על ארכיטקטורת Gemma 4 ומופץ תחת רישיון Apache 2.0. מודל עם 740 מיליון פרמטרים מיועד לפעולה על מכשיר: הוא יכול למצוא קליפ וידאו ספציפי מהערה קולית או לחפש בהקלטת אודיו של מספר שעות עם שאילתה טקסטואלית באופן מקומי, עם מודל אחד.

EmbeddingGemma 2 מחליף את EmbeddingGemma הראשון, שאסף מעל 20 מיליון הורדות ושימש לחיפוש על מכשיר ו-RAG מוכוון פרטיות. הגרסה החדשה מאחדת טקסט, קוד, תמונות, וידאו ואודיו במרחב משותף אחד.

עיצוב מודולרי ויעיל מבחינת אחסון

EmbeddingGemma 2 הוא מודולרי. לטקסט מספיקים 270 מיליון פרמטרים, ולתמיכה מולטימודלית מלאה נוספים מקודדים חזותיים (170 מיליון) ואודיו (300 מיליון). עם Matryoshka Representation Learning מפתחים יכולים לכווץ וקטורים מ-768 ממדים ל-512, 256 או 128, מה שדורש פחות פי 6 מקום אחסון במסדי נתונים וקטוריים מקומיים.

על Google Pixel 11 Pro עם קוונטיזציה, משקלי טקסט תופסים כ-191MB של RAM פעיל, והמודל המלא כ-567MB. הקונטקסט של 8K טוקנים, גדול פי ארבע מ-EmbeddingGemma 1, מאפשר מקומית עד 5.5 דקות אודיו, 29 תמונות, 58 פריימי וידאו או שילוב שלהם.

ביצועים בבנצ'מרקים

לפי Google DeepMind, EmbeddingGemma 2 הוא הטוב ביותר בין מקודדים מולטימודליים עם פחות מ-1B פרמטרים ב-MTEB Code ו-MAEB, ובטקסט, ראייה ואודיו הוא מנצח או תוהה מול מודלים גדולים בהרבה. בקוד, התוצאה ב-MTEB Code שיפרה מ-68.76 ל-78.68, כלומר ב-9.92 נקודות, מה שהופך אותו למתאים לאינדוקס מסדי קוד מקומיים, חיפוש סמנטי וסוכני קידוד. בתמונות, וידאו, מסמכים ואודיו הוא קובע סטנדרט חדש לאיכות בין מודלים עם פחות מ-1B פרמטרים ומנצח אף מודלים מתמחים גדולים פי כמה.

נגישות ושימוש על מכשיר

המשקלים זמינים ב-Hugging Face וב-Kaggle, וב-Gemini Enterprise Agent Platform Model Garden הם יופיעו בקרוב. המודל עובד עם transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama ו-LMStudio, ואחסון וקטורים אפשרי עם Qdrant. הוראות כוונון עדין מספקת Unsloth.

מפתחים יכולים לנסות את EmbeddingGemma 2 ב-Instant Media Search ו-Video Moments Finder של Google AI Edge Gallery, לשלב עם Gemma 4 ל-RAG באפליקציית Google AI Edge Foresight, או לבנות מנועי החלטות בזמן אמת עם MediaPipe Decision Task API. הפעלה על מכשיר נתמכת על ידי Google AI Edge MediaPipe, LiteRT, transformers.js ו-WebGPU.

מקורות: blog.google

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.